Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Alibaba: Paraformer v2

Paraformer v2 transkribiert aufgezeichnetes Audio für die Offline-Verarbeitung. Es ist nützlich für Meeting-Archive und längere Gesprächsaufzeichnungen, die nach Ende der Sitzung ein wiederverwendbares schriftliches Transkript benötigen.
Modelle vergleichen
paraformer-v2
VerfügbarAlibabaSprache zu TextSynchron / Asynchron
Preis
Ab $0.000012
Modalitäten
Audio

Über Paraformer v2

Paraformer v2 ist Alibabas dateibasiertes Spracherkennungsmodell für die Offline-Transkription von Meetings und langen Konversationen. Es wird asynchron für Aufnahmen mit einer Größe von bis zu 2 GB und einer Dauer von bis zu 12 Stunden aufgerufen. Im Vergleich zu Paraformer 8K v2 ist es für allgemeines Breitband-Audio konzipiert; im Vergleich zu den Echtzeitmodellen tauscht es Unmittelbarkeit gegen ein vollständiges Transkript mit Sprechererkennung (Diarization) und Hotwords ein.

Stärken

  • Verarbeitet laut Alibabas Dokumentation sehr lange Aufnahmen mit bis zu 12 Stunden oder 2 GB pro Datei.
  • Zeitstempel sind immer enthalten, daher ist keine zusätzliche Option erforderlich, um diese zu erhalten.
  • Die Sprechererkennung (Diarization) trennt die Teilnehmer in Meetings und Gruppendiskussionen.
  • Die Filterung sensibler Wörter kann aufgeführte Begriffe im Transkripttext maskieren.

Alternativen

  • Die Ergebnisse liegen nach Abschluss des Auftrags vor; für Live-Untertitel wird Paraformer Realtime v2 benötigt.
  • Für 8-kHz-Telefonaufnahmen passt die 8K-Variante besser zum Audiomaterial.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Sprache zu TextTokenLab-Endpunkt
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="paraformer-v2" \
      -F language="en"

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Sprache zu Text

pro Sekunde
Offizieller Preis
$0.00001176
Official
$0.00001176
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Paraformer v2 in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste paraformer-v2 mit einer kurzen Audio-Anfrage an /v1/audio/transcriptions. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Meeting-Archive

    Verarbeiten Sie gespeicherte Meeting-Aufnahmen zu durchsuchbarem Text mit Sprecherkennzeichnung und Zeitstempeln.

  • Vorlesungstranskripte

    Transkribieren Sie mehrstündige Vorlesungen und indexieren oder fassen Sie den Text anschließend für Studierende zusammen.

  • Vorbereitung der Inhaltsmoderation

    Maskieren Sie konfigurierte sensible Wörter in Transkripten, bevor diese an ein größeres Team weitergegeben werden.

Prompt-Beispiele

Transkribieren Sie diese 3-stündige All-Hands-Aufnahme mit Sprecherkennzeichnung und Zeitstempeln.

Transkribieren Sie das Audio dieses Vorlesungsvideos und maskieren Sie die aufgeführten sensiblen Wörter.

Transkribieren Sie diese wöchentlichen Stand-up-Aufnahmen unter Verwendung von Hotwords für unsere Projektnamen.

FAQ

Wofür eignet sich Paraformer v2 am besten?

Offline-Transkription von aufgezeichneten Meetings, Interviews und Konversationen. Es akzeptiert gängige Audio- und Videoformate mit beliebiger Abtastrate und liefert den Text zusammen mit Zeitstempeln zurück.

Wie groß darf die Eingabedatei sein?

Alibaba dokumentiert für seine Paraformer-Dateimodelle eine Größe von bis zu 2 GB und 12 Stunden. Teilen Sie längere Dateien in Abschnitte auf, bevor Sie diese zur Transkription einreichen.

Kann ich Zeitstempel deaktivieren?

Nein. Alibaba gibt an, dass Zeitstempel für Paraformer dauerhaft aktiviert sind, sodass jedes Transkript diese enthält und keine Anforderungsoption erforderlich ist, um Zeitpositionen zu erhalten.

Paraformer v2 oder Fun-ASR?

Beide transkribieren Dateien mit Sprechererkennung und Hotwords. Fun-ASR ist die neuere Produktlinie; Paraformer v2 ist die etablierte. Testen Sie eine Probe Ihres Audiomaterials mit beiden Modellen und vergleichen Sie die für Sie relevanten Fehler.

Was kostet Paraformer v2?

Auf TokenLab kostet Paraformer v2 $0.00001176 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Paraformer v2 verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/transcriptions für Paraformer v2. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Paraformer v2?

Paraformer v2 unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Paraformer v2 vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Paraformer-Serie

Ähnliche Modelle