Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Alibaba: Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 ist eine datierte Spracherkennungs-Version für die Transkription von Audiodateien. Das Festlegen auf diese Version ist nützlich, wenn eine Transkriptions-Pipeline eine konsistente Modellwahl über wiederholte Verarbeitungsläufe hinweg benötigt.
Modelle vergleichen
fun-asr-flash-2026-06-15
VerfügbarAlibabaSprache zu TextSynchron
Preis
Ab $0.000035
Modalitäten
Audio

Über Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 ist eine datierte Version von Alibabas Flash-Spracherkennungsmodell, die von Alibaba als Qwen-Audio-3.0-ASR-Flash geführt wird. Es transkribiert kurze Audiodateien über einen synchronen HTTP-Aufruf und nutzt vorangegangene Gesprächsbeiträge als Kontext, um die Erkennung zu beeinflussen. Das Festlegen auf eine datierte ID hält eine Pipeline auf einer bestimmten Version, im Gegensatz zu einem undatierten Alias, der aktualisiert werden könnte.

Stärken

  • Akzeptiert frühere Gesprächsbeiträge zusammen mit dem Audio, sodass das Vokabular aus der laufenden Diskussion die Erkennung steuert.
  • Alibaba führt wortgenaue Zeitstempel und Satzgrenzen in derselben synchronen Antwort auf.
  • Das Datum in der ID legt eine bestimmte Version fest, was wiederholte Durchläufe vergleichbar macht.

Alternativen

  • Clips sind auf etwa fünf Minuten begrenzt, daher benötigen lange Aufnahmen das asynchrone Fun-ASR oder ein Filetrans-Modell.
  • Es verarbeitet nur abgeschlossene Clips; für Live-Untertitel oder Diktate ist Fun-ASR Realtime das Streaming-Modell.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Sprache zu TextTokenLab-Endpunkt
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="fun-asr-flash-2026-06-15" \
      -F language="en"

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Sprache zu Text

pro Sekunde
Offizieller Preis
$0.000035
Official
$0.000035
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Fun-ASR Flash 2026-06-15 in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste fun-asr-flash-2026-06-15 mit einer kurzen Audio-Anfrage an /v1/audio/transcriptions. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Sprachnotizen

    Transkribieren Sie kurze aufgezeichnete Notizen und Nachrichten in einer einzigen Anfrage, ohne einen asynchronen Job in eine Warteschlange stellen zu müssen.

  • Medizinisches Diktat

    Übergeben Sie den vorangegangenen Dialog als Kontext, damit Medikamentennamen und klinische Fachbegriffe mit höherer Wahrscheinlichkeit erkannt werden.

  • Fixierte Test-Pipelines

    Halten Sie die Version konstant, während Sie nachgelagerte Zusammenfassungsänderungen mit denselben Transkripten vergleichen.

Prompt-Beispiele

Transkribieren Sie diese 3-minütige Klinikaufnahme; Kontext: Im vorherigen Beitrag wurde die Metformin-Dosierung besprochen.

Transkribieren Sie diese Sprachnotiz eines Außendiensttechnikers über einen SPS-Fehler und geben Sie Wort-Zeitstempel zurück.

Transkribieren Sie diesen kurzen Clip eines Kundengesprächs unter Verwendung der früheren Chat-Beiträge als Kontext.

FAQ

Was bedeutet das Datum in fun-asr-flash-2026-06-15?

Es identifiziert eine spezifische Version vom 15. Juni 2026. Der Aufruf der datierten ID hält Ihre Pipeline auf dieser Version. Alibaba präsentiert es unter dem Namen Qwen-Audio-3.0-ASR-Flash.

Wie lang darf ein Audioclip sein?

Alibaba dokumentiert ein Limit von etwa fünf Minuten pro Aufruf bei Dateien bis zu 2 GB. Für längere Aufnahmen verwenden Sie Fun-ASR oder Qwen3 ASR Flash Filetrans, die beide asynchrone Datei-Jobs verarbeiten.

Kann ich Kontext zum Gespräch angeben?

Ja. Es verwendet ein Chat-ähnliches Nachrichtenformat, sodass Sie frühere Beiträge vor dem Audio übergeben können. Das Modell nutzt diese, um Vokabular zu bevorzugen, das zum Thema passt, was bei Fachbegriffen hilft.

Gibt es Zeitstempel zurück?

Ja. Alibaba beschreibt wortgenaue Zeitstempel und Satzgrenzen in der Antwort, sodass Sie den Text für Untertitel, Überprüfungen oder Suchen ohne einen separaten Ausrichtungsschritt mit dem Audio abgleichen können.

Was kostet Fun-ASR Flash 2026-06-15?

Auf TokenLab kostet Fun-ASR Flash 2026-06-15 $0.000035 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Fun-ASR Flash 2026-06-15 verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/transcriptions für Fun-ASR Flash 2026-06-15. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Fun-ASR Flash 2026-06-15?

Fun-ASR Flash 2026-06-15 unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Fun-ASR Flash 2026-06-15 vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Fun-ASR-Serie

Ähnliche Modelle