Alibaba: Paraformer Realtime v2
paraformer-realtime-v2- Preis
- Ab $0.000035
- Modalitäten
- Audio
Über Paraformer Realtime v2
Paraformer Realtime v2 ist Alibabas allgemeiner Streaming-Spracherkenner, der Text zurückgibt, während das Audio noch eintrifft. Er zielt auf Untertitel, Spracheingabe und Meeting-Schnittstellen ab, bei denen das Transkript aktualisiert werden soll, während die Personen weiter sprechen. Im Gegensatz zur 8K-Variante ist er nicht an die Telefonbandbreite gebunden, und im Gegensatz zu Fun-ASR Realtime gehört er zur älteren Paraformer-Reihe.
Stärken
- Aktualisiert das Transkript kontinuierlich, was für Live-Untertitel und Meeting-Bildschirme geeignet ist.
- Funktioniert mit allgemeinem Breitband-Audio wie von Headsets und Raummikrofonen, nicht nur mit Telefonleitungen.
- Unterstützt Hotwords für Namen und Begriffe, die häufig in Ihren Sitzungen vorkommen.
- Liefert Zeitstempel mit den gestreamten Ergebnissen zur Synchronisierung von Untertiteln.
Alternativen
- Telefon-Audio mit 8 kHz Qualität wird besser durch Paraformer Realtime 8K v2 abgedeckt.
- Streaming bedeutet keinen zweiten Durchlauf über das Audio; verwenden Sie ein Dateimodell, wenn höchste Genauigkeit entscheidend ist.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Sprache zu TextWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Echtzeit / Sprache zu Text
pro Sekunde- Offizieller Preis
- $0.00003529
- Official
- $0.00003529
- Rabatt
- —
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Echtzeit / Sprache zu Text | $0.00003529 | $0.00003529 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Paraformer Realtime v2 in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste paraformer-realtime-v2 mit einer kurzen Audio-Anfrage an /v1/realtime. Zeige Ergebnis und Kosten.
Anwendungsfälle
Meeting-Untertitel
Zeigen Sie ein Live-Transkript während eines Video-Meetings an, damit Teilnehmer folgen oder verpasste Wörter nachlesen können.
Spracheingabe
Wandeln Sie Diktate in einem Editor oder Formular in Text um, während der Benutzer spricht.
Live-Event-Untertitel
Fügen Sie Untertitel zu einem Vortrag oder einer Übertragung hinzu, die jeden Satz aktualisieren, sobald der Sprecher endet.
Prompt-Beispiele
Streamen Sie dieses Live-Meeting-Audio und zeigen Sie Untertitel an, während die Personen sprechen.
Diktieren Sie ein Support-Ticket per Sprache und füllen Sie das Textfeld, während ich spreche.
Streamen Sie eine Konferenz-Keynote mit Hotwords für den Sprecher und Produktnamen.
FAQ
Ist Paraformer Realtime v2 für Telefonanrufe geeignet?
Nicht primär. Für 8-kHz-Telefon-Audio bietet Alibaba Paraformer Realtime 8K v2 an. Dieses Modell zielt auf allgemeines Live-Audio von Mikrofonen, Headsets und Meeting-Software ab.
Wie ist der Vergleich zu Fun-ASR Realtime?
Beide streamen. Fun-ASR Realtime ist die neuere Fun-ASR-Reihe mit gelisteter Dialektunterstützung, während Paraformer Realtime v2 die etablierte Paraformer-Option ist. Testen Sie beide mit Ihrem Audio und behalten Sie diejenige, die passt.
Was ist die Integrationsmethode?
Eine WebSocket-Sitzung über das DashScope SDK oder das Raw-Protokoll. Ihr Client sendet Audio in Chunks, und Erkennungsereignisse kommen kontinuierlich zurück, solange die Sitzung geöffnet bleibt.
Kann es eine fertige Datei transkribieren?
Es ist für Streams konzipiert. Für fertige Aufnahmen verwenden Sie Paraformer v2, das dateibasierte Gegenstück, das die gesamte Datei verarbeitet und Zeitstempel mit jedem Ergebnis zurückgibt.
Was kostet Paraformer Realtime v2?
Auf TokenLab kostet Paraformer Realtime v2 $0.00003529 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll Paraformer Realtime v2 verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/realtime für Paraformer Realtime v2. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Paraformer Realtime v2?
Paraformer Realtime v2 unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Paraformer Realtime v2 vergleichen
Quellen
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Geprüft am 02.10.2026