Alibaba: Paraformer v2
paraformer-v2- Preis
- Ab $0.000012
- Modalitäten
- Audio
Über Paraformer v2
Paraformer v2 ist Alibabas dateibasiertes Spracherkennungsmodell für die Offline-Transkription von Meetings und langen Konversationen. Es wird asynchron für Aufnahmen mit einer Größe von bis zu 2 GB und einer Dauer von bis zu 12 Stunden aufgerufen. Im Vergleich zu Paraformer 8K v2 ist es für allgemeines Breitband-Audio konzipiert; im Vergleich zu den Echtzeitmodellen tauscht es Unmittelbarkeit gegen ein vollständiges Transkript mit Sprechererkennung (Diarization) und Hotwords ein.
Stärken
- Verarbeitet laut Alibabas Dokumentation sehr lange Aufnahmen mit bis zu 12 Stunden oder 2 GB pro Datei.
- Zeitstempel sind immer enthalten, daher ist keine zusätzliche Option erforderlich, um diese zu erhalten.
- Die Sprechererkennung (Diarization) trennt die Teilnehmer in Meetings und Gruppendiskussionen.
- Die Filterung sensibler Wörter kann aufgeführte Begriffe im Transkripttext maskieren.
Alternativen
- Die Ergebnisse liegen nach Abschluss des Auftrags vor; für Live-Untertitel wird Paraformer Realtime v2 benötigt.
- Für 8-kHz-Telefonaufnahmen passt die 8K-Variante besser zum Audiomaterial.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Sprache zu TextTokenLab-EndpunktPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Sprache zu Text
pro Sekunde- Offizieller Preis
- $0.00001176
- Official
- $0.00001176
- Rabatt
- —
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Sprache zu Text | $0.00001176 | $0.00001176 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Paraformer v2 in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste paraformer-v2 mit einer kurzen Audio-Anfrage an /v1/audio/transcriptions. Zeige Ergebnis und Kosten.
Anwendungsfälle
Meeting-Archive
Verarbeiten Sie gespeicherte Meeting-Aufnahmen zu durchsuchbarem Text mit Sprecherkennzeichnung und Zeitstempeln.
Vorlesungstranskripte
Transkribieren Sie mehrstündige Vorlesungen und indexieren oder fassen Sie den Text anschließend für Studierende zusammen.
Vorbereitung der Inhaltsmoderation
Maskieren Sie konfigurierte sensible Wörter in Transkripten, bevor diese an ein größeres Team weitergegeben werden.
Prompt-Beispiele
Transkribieren Sie diese 3-stündige All-Hands-Aufnahme mit Sprecherkennzeichnung und Zeitstempeln.
Transkribieren Sie das Audio dieses Vorlesungsvideos und maskieren Sie die aufgeführten sensiblen Wörter.
Transkribieren Sie diese wöchentlichen Stand-up-Aufnahmen unter Verwendung von Hotwords für unsere Projektnamen.
FAQ
Wofür eignet sich Paraformer v2 am besten?
Offline-Transkription von aufgezeichneten Meetings, Interviews und Konversationen. Es akzeptiert gängige Audio- und Videoformate mit beliebiger Abtastrate und liefert den Text zusammen mit Zeitstempeln zurück.
Wie groß darf die Eingabedatei sein?
Alibaba dokumentiert für seine Paraformer-Dateimodelle eine Größe von bis zu 2 GB und 12 Stunden. Teilen Sie längere Dateien in Abschnitte auf, bevor Sie diese zur Transkription einreichen.
Kann ich Zeitstempel deaktivieren?
Nein. Alibaba gibt an, dass Zeitstempel für Paraformer dauerhaft aktiviert sind, sodass jedes Transkript diese enthält und keine Anforderungsoption erforderlich ist, um Zeitpositionen zu erhalten.
Paraformer v2 oder Fun-ASR?
Beide transkribieren Dateien mit Sprechererkennung und Hotwords. Fun-ASR ist die neuere Produktlinie; Paraformer v2 ist die etablierte. Testen Sie eine Probe Ihres Audiomaterials mit beiden Modellen und vergleichen Sie die für Sie relevanten Fehler.
Was kostet Paraformer v2?
Auf TokenLab kostet Paraformer v2 $0.00001176 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll Paraformer v2 verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/audio/transcriptions für Paraformer v2. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Paraformer v2?
Paraformer v2 unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Paraformer v2 vergleichen
Quellen
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
Geprüft am 02.10.2026