Audio-Modelle

KI-Modelle für Sprache, Musik und Audioverarbeitung

Audio · Alibaba Cloud

cosyvoice-v3.5-plus
Verfügbar
Text zu Sprache
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$22.06Ausgabe$0.00/1 Mio. Zeichen
qwen3.5-omni-flash-realtime
Verfügbar
Tool-NutzungVisionWebsuche
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$3.97Ausgabe$15.74/1M
qwen3.5-omni-plus-realtime
Verfügbar
Tool-NutzungVisionWebsuche
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$11.76Ausgabe$44.12/1M
qwen3-livetranslate-flash
Verfügbar
Vision
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$1.47Ausgabe$1.47/1M
qwen3.5-livetranslate-flash-realtime
Verfügbar
Vision
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$5.88Ausgabe$14.71/1M
fun-asr
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00003235/Sek
fun-asr-flash-2026-06-15
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00003235/Sek
fun-asr-realtime
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00004853/Sek
paraformer-8k-v2
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00001177/Sek
paraformer-realtime-8k-v2
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.0000353/Sek
paraformer-realtime-v2
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.0000353/Sek
paraformer-v2
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00001177/Sek
qwen3-asr-flash
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00003235/Sek
qwen3-asr-flash-filetrans
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00003235/Sek
qwen3-asr-flash-realtime
Verfügbar
Sprache zu Text
TokenLab-Preis— Rabatt
—
Offizieller Preis
$0.00004853/Sek
qwen3-tts-flash
Verfügbar
Text zu Sprache
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$11.76Ausgabe$0.00/1 Mio. Zeichen
qwen3-tts-flash-realtime
Verfügbar
Text zu Sprache
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$14.71Ausgabe$0.00/1 Mio. Zeichen
sambert-zhiyuan-v1
Verfügbar
Text zu Sprache
TokenLab-Preis— Rabatt
—
Offizieller Preis
Eingabe$14.71Ausgabe$0.00/1 Mio. Zeichen

Alle Modellreihen

3 Serien

Das richtige Audio-Modell finden

Das ideale Modell findet die Balance zwischen Aufgabe, Qualität, Latenz und Preis.

Auswahlsignale

  • Wähle das Modell passend zu deinem benötigten Input und Output.
  • Vergleiche nur Modelle mit identischen Preiseinheiten.
  • Ein kurzer Test zeigt Qualitäts- und Latenzunterschiede, die kein Katalog abbilden kann.

FAQ

Was zeichnet ein gutes Audio-Modell aus?

Ein passendes Modell erfüllt deine Anforderungen an Qualität, Latenz und Budget. Mit einem kleinen Test-Set lassen sich Unterschiede in Qualität und Zuverlässigkeit direkt erkennen.

Kann ich das Modell später wechseln?

Ja. Behalte die öffentliche Modell-ID und das Request-Format bei, um Alternativen bei gleichen Aufgaben zu vergleichen.