Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Alibaba: Fun-ASR Realtime

Fun-ASR Realtime verarbeitet eingehendes Audio während eine Sitzung fortschreitet. Es ist für Live-Transkriptionserlebnisse wie Untertitel und Spracheingabe konzipiert, bei denen das Warten auf eine vollständige Aufnahme die Interaktion unterbrechen würde.
Modelle vergleichen
fun-asr-realtime
VerfügbarAlibabaSprache zu TextSynchron
Preis
Ab $0.00009
Modalitäten
Audio

Über Fun-ASR Realtime

Fun-ASR Realtime ist Alibabas Streaming-Spracherkennungsmodell: Es empfängt Audio über eine Live-Sitzung und gibt Text zurück, während die Personen sprechen. Es ist die Fun-ASR-Variante für Untertitel, Spracheingabe und In-Call-Unterstützung, bei der das Fun-ASR für aufgezeichnetes Audio die Benutzer zwingen würde, bis zum Ende der Aufnahme zu warten. Alibaba führt Hotwords, Zeitstempel und Mandarin mit Dialekten wie Kantonesisch und Sichuanesisch auf.

Stärken

  • Streamt Teiltext, während der Sprecher noch spricht, sodass Untertitel erscheinen, ohne auf eine fertige Aufnahme warten zu müssen.
  • Erkennt laut Alibabas Dokumentation Mandarin mit hoher Genauigkeit sowie verschiedene Dialekte, einschließlich Kantonesisch und Sichuanesisch.
  • Benutzerdefinierte Hotwords steuern die Live-Erkennung in Richtung von Namen und Begriffen, die für Ihr Produkt spezifisch sind.
  • Wort- und satzgenaue Zeitstempel kommen mit dem Stream an, was beim Ausrichten von Untertiteln hilft.

Alternativen

  • Es erfordert eine WebSocket-Sitzung, was einen höheren Integrationsaufwand bedeutet als das Hochladen einer Aufnahme bei Fun-ASR.
  • Die Live-Dekodierung kann nicht auf früheres Audio zurückgreifen, daher ist für Archivierungszwecke das Fun-ASR für aufgezeichnetes Audio die sicherere Wahl.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Sprache zu TextWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Echtzeit / Sprache zu Text

pro Sekunde
Offizieller Preis
$0.00009
Official
$0.00009
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Fun-ASR Realtime in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste fun-asr-realtime mit einer kurzen Audio-Anfrage an /v1/realtime. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Live-Untertitel

    Zeigen Sie Untertitel für ein Webinar oder eine Veranstaltung an, während der Sprecher spricht, und aktualisieren Sie jeden Satz, sobald er abgeschlossen ist.

  • Spracheingabe

    Lassen Sie Benutzer in ein Formular oder ein Chat-Fenster diktieren und sehen Sie, wie ihre Worte erscheinen, während sie sprechen.

  • Dialektbewusste Assistenten

    Verarbeiten Sie gesprochene Anfragen in Mandarin und regionalen Dialekten in einer App, die nicht auf eine vollständige Aufnahme warten kann.

Prompt-Beispiele

Streamen Sie Mikrofon-Audio für eine Mandarin-Produkteinführung und geben Sie Untertitel aus, sobald jeder Satz endet.

Transkribieren Sie ein Live-Kundengespräch auf Kantonesisch mit den Hotwords 'Rückerstattung' und 'Bestellnummer'.

Streamen Sie eine Schulungssitzung und behalten Sie Wort-Zeitstempel für spätere Ausschnitte bei.

FAQ

Wann sollte ich Fun-ASR Realtime gegenüber Fun-ASR wählen?

Wählen Sie Realtime, wenn Text erscheinen muss, während das Audio noch gesprochen wird, wie bei Untertiteln oder Diktaten. Wählen Sie das Fun-ASR für aufgezeichnetes Audio, wenn Sie eine fertige Aufnahme haben und Diarisierung oder Archivierungsgenauigkeit benötigen.

Wie sende ich Audio an das Modell?

Über eine Streaming-WebSocket-Sitzung, entweder über Alibabas DashScope SDK oder das Rohprotokoll. Sie senden Audio-Chunks und erhalten erkannte Text-Events zurück, während die Sitzung fortgesetzt wird.

Unterstützt es Dialekte?

Ja. Die Echtzeit-Dokumentation von Alibaba führt Mandarin sowie Kantonesisch, Sichuanesisch und andere Dialekte auf, neben benutzerdefinierten Hotwords, die bei Namen und Produktbegriffen helfen. Dialektsprache wird in derselben Live-Sitzung wie Standard-Mandarin erkannt.

Kann es mit Stille zwischen Sätzen umgehen?

Ja, es enthält eine Spracherkennung (Voice Activity Detection), die Nicht-Sprach-Audio herausfiltert und entscheidet, wo Sätze enden. Die Stille-Schwellenwerte sind in den Sitzungseinstellungen konfigurierbar, sodass Sie anpassen können, wie schnell Untertitel erscheinen.

Was kostet Fun-ASR Realtime?

Auf TokenLab kostet Fun-ASR Realtime $0.00009 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Fun-ASR Realtime verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/realtime für Fun-ASR Realtime. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Fun-ASR Realtime?

Fun-ASR Realtime unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Fun-ASR Realtime vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Fun-ASR-Serie

Ähnliche Modelle