Alibaba: Fun-ASR Realtime
fun-asr-realtime- Preis
- Ab $0.00009
- Modalitäten
- Audio
Über Fun-ASR Realtime
Fun-ASR Realtime ist Alibabas Streaming-Spracherkennungsmodell: Es empfängt Audio über eine Live-Sitzung und gibt Text zurück, während die Personen sprechen. Es ist die Fun-ASR-Variante für Untertitel, Spracheingabe und In-Call-Unterstützung, bei der das Fun-ASR für aufgezeichnetes Audio die Benutzer zwingen würde, bis zum Ende der Aufnahme zu warten. Alibaba führt Hotwords, Zeitstempel und Mandarin mit Dialekten wie Kantonesisch und Sichuanesisch auf.
Stärken
- Streamt Teiltext, während der Sprecher noch spricht, sodass Untertitel erscheinen, ohne auf eine fertige Aufnahme warten zu müssen.
- Erkennt laut Alibabas Dokumentation Mandarin mit hoher Genauigkeit sowie verschiedene Dialekte, einschließlich Kantonesisch und Sichuanesisch.
- Benutzerdefinierte Hotwords steuern die Live-Erkennung in Richtung von Namen und Begriffen, die für Ihr Produkt spezifisch sind.
- Wort- und satzgenaue Zeitstempel kommen mit dem Stream an, was beim Ausrichten von Untertiteln hilft.
Alternativen
- Es erfordert eine WebSocket-Sitzung, was einen höheren Integrationsaufwand bedeutet als das Hochladen einer Aufnahme bei Fun-ASR.
- Die Live-Dekodierung kann nicht auf früheres Audio zurückgreifen, daher ist für Archivierungszwecke das Fun-ASR für aufgezeichnetes Audio die sicherere Wahl.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Sprache zu TextWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Echtzeit / Sprache zu Text
pro Sekunde- Offizieller Preis
- $0.00009
- Official
- $0.00009
- Rabatt
- —
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Echtzeit / Sprache zu Text | $0.00009 | $0.00009 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Fun-ASR Realtime in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste fun-asr-realtime mit einer kurzen Audio-Anfrage an /v1/realtime. Zeige Ergebnis und Kosten.
Anwendungsfälle
Live-Untertitel
Zeigen Sie Untertitel für ein Webinar oder eine Veranstaltung an, während der Sprecher spricht, und aktualisieren Sie jeden Satz, sobald er abgeschlossen ist.
Spracheingabe
Lassen Sie Benutzer in ein Formular oder ein Chat-Fenster diktieren und sehen Sie, wie ihre Worte erscheinen, während sie sprechen.
Dialektbewusste Assistenten
Verarbeiten Sie gesprochene Anfragen in Mandarin und regionalen Dialekten in einer App, die nicht auf eine vollständige Aufnahme warten kann.
Prompt-Beispiele
Streamen Sie Mikrofon-Audio für eine Mandarin-Produkteinführung und geben Sie Untertitel aus, sobald jeder Satz endet.
Transkribieren Sie ein Live-Kundengespräch auf Kantonesisch mit den Hotwords 'Rückerstattung' und 'Bestellnummer'.
Streamen Sie eine Schulungssitzung und behalten Sie Wort-Zeitstempel für spätere Ausschnitte bei.
FAQ
Wann sollte ich Fun-ASR Realtime gegenüber Fun-ASR wählen?
Wählen Sie Realtime, wenn Text erscheinen muss, während das Audio noch gesprochen wird, wie bei Untertiteln oder Diktaten. Wählen Sie das Fun-ASR für aufgezeichnetes Audio, wenn Sie eine fertige Aufnahme haben und Diarisierung oder Archivierungsgenauigkeit benötigen.
Wie sende ich Audio an das Modell?
Über eine Streaming-WebSocket-Sitzung, entweder über Alibabas DashScope SDK oder das Rohprotokoll. Sie senden Audio-Chunks und erhalten erkannte Text-Events zurück, während die Sitzung fortgesetzt wird.
Unterstützt es Dialekte?
Ja. Die Echtzeit-Dokumentation von Alibaba führt Mandarin sowie Kantonesisch, Sichuanesisch und andere Dialekte auf, neben benutzerdefinierten Hotwords, die bei Namen und Produktbegriffen helfen. Dialektsprache wird in derselben Live-Sitzung wie Standard-Mandarin erkannt.
Kann es mit Stille zwischen Sätzen umgehen?
Ja, es enthält eine Spracherkennung (Voice Activity Detection), die Nicht-Sprach-Audio herausfiltert und entscheidet, wo Sätze enden. Die Stille-Schwellenwerte sind in den Sitzungseinstellungen konfigurierbar, sodass Sie anpassen können, wie schnell Untertitel erscheinen.
Was kostet Fun-ASR Realtime?
Auf TokenLab kostet Fun-ASR Realtime $0.00009 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll Fun-ASR Realtime verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/realtime für Fun-ASR Realtime. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Fun-ASR Realtime?
Fun-ASR Realtime unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Fun-ASR Realtime vergleichen
Quellen
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Geprüft am 02.10.2026