Alibaba: Paraformer v2
paraformer-v2- Preço
- A partir de $0.000012
- Modalidades
- Áudio
Sobre o Paraformer v2
Paraformer v2 é o modelo de reconhecimento de fala baseado em arquivos da Alibaba para transcrições offline de reuniões e conversas longas. Ele é chamado de forma assíncrona em gravações de até 2 GB e 12 horas. Comparado ao Paraformer 8K v2, ele é destinado a áudio de banda larga geral e, em comparação com os modelos em tempo real, troca a imediatismo por uma transcrição completa com diarização e palavras-chave (hotwords).
Pontos fortes
- Lida com gravações muito longas, de até 12 horas ou 2 GB por arquivo, conforme a documentação da Alibaba.
- Carimbos de data/hora (timestamps) estão sempre incluídos, portanto, nenhuma opção extra é necessária para obtê-los.
- A diarização de locutor separa os participantes em reuniões e discussões em grupo.
- A filtragem de palavras sensíveis pode mascarar termos listados no texto da transcrição.
Quando usar outro modelo
- Os resultados chegam após a conclusão do trabalho; legendas ao vivo exigem o Paraformer Realtime v2.
- Para gravações telefônicas de 8 kHz, a variante 8K corresponde melhor ao áudio.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Fala para textoEndpoint do TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Fala para texto
por segundo- Preço oficial
- $0.00001176
- Official
- $0.00001176
- Desconto
- —
| Preço oficialpor segundo | Officialpor segundo | Desconto | |
|---|---|---|---|
| Fala para texto | $0.00001176 | $0.00001176 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Paraformer v2 no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar paraformer-v2 com uma solicitação de áudio em /v1/audio/transcriptions. Exiba o resultado e custo.
Casos de uso
Arquivos de reuniões
Processe gravações de reuniões salvas em texto pesquisável com etiquetas de locutor e carimbos de data/hora.
Transcrições de palestras
Transcreva palestras de várias horas de uma só vez e, em seguida, indexe ou resuma o texto para os alunos.
Preparação para moderação de conteúdo
Mascare palavras sensíveis configuradas em transcrições antes que sejam compartilhadas com uma equipe maior.
Exemplos de prompt
Transcreva esta gravação de 3 horas de uma reunião geral com etiquetas de locutor e carimbos de data/hora.
Transcreva o áudio deste vídeo de palestra e mascare as palavras sensíveis listadas.
Transcreva estas gravações de reuniões semanais (stand-ups) usando palavras-chave para os nomes dos nossos projetos.
FAQ
Para que o Paraformer v2 é melhor indicado?
Transcrição offline de reuniões, entrevistas e conversas gravadas. Ele aceita formatos de áudio e vídeo convencionais em qualquer taxa de amostragem e retorna o texto juntamente com carimbos de data/hora.
Qual o tamanho máximo da entrada?
A Alibaba documenta arquivos de até 2 GB e 12 horas para seus modelos de arquivo Paraformer. Divida qualquer conteúdo mais longo em partes antes de enviá-lo para transcrição.
Posso desativar os carimbos de data/hora?
Não. A Alibaba afirma que os carimbos de data/hora estão permanentemente ativados para o Paraformer, portanto, toda transcrição os contém e nenhuma opção de solicitação é necessária para obter as posições de tempo.
Paraformer v2 ou Fun-ASR?
Ambos transcrevem arquivos com diarização e palavras-chave. O Fun-ASR é a linha mais recente; o Paraformer v2 é a linha estabelecida. Execute uma amostra do seu áudio em cada um e compare os erros que são importantes para você.
Quanto custa o Paraformer v2?
No TokenLab, Paraformer v2 custa $0.00001176 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Paraformer v2 deve usar?
Use https://api.tokenlab.sh/v1/audio/transcriptions para Paraformer v2. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Paraformer v2 suporta?
Paraformer v2 suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Paraformer v2
Fontes
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
Revisado em 2 de out. de 2026