Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Alibaba: Paraformer v2

O Paraformer v2 transcreve áudio gravado para processamento offline. É útil para arquivos de reuniões e gravações de conversas mais longas que precisam de uma transcrição escrita reutilizável após o término da sessão.
Comparar modelos
paraformer-v2
DisponívelAlibabaFala para TextoSíncrono / Assíncrono
Preço
A partir de $0.000012
Modalidades
Áudio

Sobre o Paraformer v2

Paraformer v2 é o modelo de reconhecimento de fala baseado em arquivos da Alibaba para transcrições offline de reuniões e conversas longas. Ele é chamado de forma assíncrona em gravações de até 2 GB e 12 horas. Comparado ao Paraformer 8K v2, ele é destinado a áudio de banda larga geral e, em comparação com os modelos em tempo real, troca a imediatismo por uma transcrição completa com diarização e palavras-chave (hotwords).

Pontos fortes

  • Lida com gravações muito longas, de até 12 horas ou 2 GB por arquivo, conforme a documentação da Alibaba.
  • Carimbos de data/hora (timestamps) estão sempre incluídos, portanto, nenhuma opção extra é necessária para obtê-los.
  • A diarização de locutor separa os participantes em reuniões e discussões em grupo.
  • A filtragem de palavras sensíveis pode mascarar termos listados no texto da transcrição.

Quando usar outro modelo

  • Os resultados chegam após a conclusão do trabalho; legendas ao vivo exigem o Paraformer Realtime v2.
  • Para gravações telefônicas de 8 kHz, a variante 8K corresponde melhor ao áudio.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Fala para textoEndpoint do TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="paraformer-v2" \
      -F language="en"

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Fala para texto

por segundo
Preço oficial
$0.00001176
Official
$0.00001176
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Paraformer v2 no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar paraformer-v2 com uma solicitação de áudio em /v1/audio/transcriptions. Exiba o resultado e custo.

Casos de uso

  • Arquivos de reuniões

    Processe gravações de reuniões salvas em texto pesquisável com etiquetas de locutor e carimbos de data/hora.

  • Transcrições de palestras

    Transcreva palestras de várias horas de uma só vez e, em seguida, indexe ou resuma o texto para os alunos.

  • Preparação para moderação de conteúdo

    Mascare palavras sensíveis configuradas em transcrições antes que sejam compartilhadas com uma equipe maior.

Exemplos de prompt

Transcreva esta gravação de 3 horas de uma reunião geral com etiquetas de locutor e carimbos de data/hora.

Transcreva o áudio deste vídeo de palestra e mascare as palavras sensíveis listadas.

Transcreva estas gravações de reuniões semanais (stand-ups) usando palavras-chave para os nomes dos nossos projetos.

FAQ

Para que o Paraformer v2 é melhor indicado?

Transcrição offline de reuniões, entrevistas e conversas gravadas. Ele aceita formatos de áudio e vídeo convencionais em qualquer taxa de amostragem e retorna o texto juntamente com carimbos de data/hora.

Qual o tamanho máximo da entrada?

A Alibaba documenta arquivos de até 2 GB e 12 horas para seus modelos de arquivo Paraformer. Divida qualquer conteúdo mais longo em partes antes de enviá-lo para transcrição.

Posso desativar os carimbos de data/hora?

Não. A Alibaba afirma que os carimbos de data/hora estão permanentemente ativados para o Paraformer, portanto, toda transcrição os contém e nenhuma opção de solicitação é necessária para obter as posições de tempo.

Paraformer v2 ou Fun-ASR?

Ambos transcrevem arquivos com diarização e palavras-chave. O Fun-ASR é a linha mais recente; o Paraformer v2 é a linha estabelecida. Execute uma amostra do seu áudio em cada um e compare os erros que são importantes para você.

Quanto custa o Paraformer v2?

No TokenLab, Paraformer v2 custa $0.00001176 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Paraformer v2 deve usar?

Use https://api.tokenlab.sh/v1/audio/transcriptions para Paraformer v2. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Paraformer v2 suporta?

Paraformer v2 suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Paraformer v2

Fontes

Revisado em 2 de out. de 2026

Mais da série Paraformer

Modelos relacionados