Alibaba: Qwen Flash
qwen-flash- Eingabe / Ausgabe
- $0.05 / $0.40
- Kontext
- 998K
- Maximale Ausgabe
- 32K
- Modalitäten
- Unterhaltung
- Funktionen
- Prompt-CacheReasoning
Über Qwen Flash
Qwen Flash ist Alibabas schnelles, kostengünstiges allgemeines Textmodell aus der Qwen-Reihe, das auf hochvolumige Aufgaben wie Zusammenfassungen, Umschreiben und einfache Assistenten ausgerichtet ist. Es liegt in der Leistungsfähigkeit unter Qwen Plus und Qwen Max und ist die erste Wahl, wenn Volumen wichtiger als Tiefe ist. Alibaba führt es unter seinen Legacy-Qwen-Namen, wobei für neue Projekte die neueren Qwen3-Generationen empfohlen werden.
Stärken
- Zusammenfassen und Neuformatieren großer Textmengen bei geringer Latenz pro Anfrage.
- Ein langes Quelldokument während der Zusammenfassung oder Beantwortung in der Konversation verfügbar halten.
- Ein optionaler Denk-Modus ermöglicht es, Reasoning nur für Anfragen zu nutzen, die dies erfordern.
- Prompt-Caching reduziert wiederholte Arbeit, wenn ein langer System-Prompt oder ein Dokument wiederverwendet wird.
Alternativen
- Nur Texteingabe, ohne Tool-Calling.
- Reasoning-Tiefe und Schreibqualität liegen bei komplexen Analyseaufgaben hinter Qwen Plus und Qwen Max.
- Alibaba führt es als Legacy-Namen, daher könnte ein aktuelles Qwen3-Modell für einen neuen Build besser geeignet sein.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Text-zu-TextResponses APIPOST/v1/responsesAPI-Format:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
Preise
Der TokenLab-Preis gilt für Verified und ist bei den meisten Modellen günstiger. Der Official-Preis entspricht dem Standardpreis des Herstellers für die zuverlässigere Route. Auto berechnet jeweils die Route, die deine Anfrage erfolgreich verarbeitet.
Eingabe Token <= 125K
Pro 1M Token- Offizieller Preis
- Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40
- Official
- Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40
- Rabatt
- —
Eingabe Token <= 250K
Pro 1M Token- Offizieller Preis
- Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40
- Official
- Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40
- Rabatt
- —
Eingabe Token <= 1M
Pro 1M Token- Offizieller Preis
- Eingabe $0.25 / Ausgabe $2.00 / Cache-Lesevorgang $0.05 / Cache-Schreibvorgang $0.3125 / Text Eingabe $0.25 / Text Ausgabe $2.00
- Official
- Eingabe $0.25 / Ausgabe $2.00 / Cache-Lesevorgang $0.05 / Cache-Schreibvorgang $0.3125 / Text Eingabe $0.25 / Text Ausgabe $2.00
- Rabatt
- —
Cache-Lesevorgang
- Offizieller Preis
- $0.01
- Official
- $0.01
- Rabatt
- —
Cache-Schreibvorgang
- Offizieller Preis
- $0.0625
- Official
- $0.0625
- Rabatt
- —
| Offizieller PreisPro 1M Token | OfficialPro 1M Token | Rabatt | |
|---|---|---|---|
| Eingabe Token <= 125K | Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40 | Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40 | — |
| Eingabe Token <= 250K | Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40 | Eingabe $0.05 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.0625 / Text Eingabe $0.05 / Text Ausgabe $0.40 | — |
| Eingabe Token <= 1M | Eingabe $0.25 / Ausgabe $2.00 / Cache-Lesevorgang $0.05 / Cache-Schreibvorgang $0.3125 / Text Eingabe $0.25 / Text Ausgabe $2.00 | Eingabe $0.25 / Ausgabe $2.00 / Cache-Lesevorgang $0.05 / Cache-Schreibvorgang $0.3125 / Text Eingabe $0.25 / Text Ausgabe $2.00 | — |
| Prompt-Cache-Preise | |||
| Cache-Lesevorgang | $0.01 | $0.01 | — |
| Cache-Schreibvorgang | $0.0625 | $0.0625 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Qwen Flash in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste qwen-flash mit einer kurzen Nachricht an /v1/responses. Zeige Antwort, Latenz und Kosten.
Anwendungsfälle
Geeignet für- Reasoning
Massen-Zusammenfassung
Fassen Sie Tausende von Artikeln, Gesprächsprotokollen oder Bewertungen in kurzen Zusammenfassungen zusammen, wobei derselbe Prompt auf jedes Element angewendet wird.
Inhaltstransformation
Konvertieren Sie Texte zwischen Tonalitäten, Sprachen oder Formaten, wie z. B. Notizen in eine ausgefeilte E-Mail oder eine Tabelle in Fließtext.
Leichte Chat-Assistenten
Unterstützen Sie einen FAQ-Bot oder In-App-Helfer, bei dem Antworten kurz sind und die Antwortzeit wichtiger als Nuancen ist.
Q&A für lange Dokumente
Fügen Sie ein langes Handbuch oder Regelwerk in den Prompt ein und beantworten Sie Mitarbeiterfragen direkt daraus.
Prompt-Beispiele
Schreiben Sie die folgende Produktbeschreibung in einem freundlichen Ton um, maximal 60 Wörter, und behalten Sie die Modellnummer bei.
Fassen Sie dieses Besprechungsprotokoll als Entscheidungen, Aufgaben mit Verantwortlichen und ungeklärte Fragen zusammen.
Beantworten Sie nur unter Verwendung des oben genannten Regeltextes: Kann ein Auftragnehmer Reisekosten geltend machen? Zitieren Sie die verwendete Klausel.
Dieses Modell hat konditionale Preise. Monatliche Token-Summen allein liefern keine verlässliche Schätzung; nutzen Sie die detaillierten Preise für Anfragespezifikation, Cache und Zeitfenster.
FAQ
Wofür eignet sich Qwen Flash am besten?
Hochvolumige Alltagsaufgaben: Zusammenfassungen, Umschreiben, übersetzungsähnliche Transformationen und einfache Assistenten. Es ist die schnelle, kostengünstige Stufe der Qwen-Reihe; verwenden Sie es daher, wenn Durchsatz wichtig ist und die Aufgabe kein tiefes Reasoning erfordert.
Wie unterscheidet sich Qwen Flash von Qwen Plus?
Flash ist die auf Geschwindigkeit ausgerichtete Stufe und Plus die ausgewogene. Plus bietet eine stärkere Analyse und Schreibqualität; Flash erledigt einfache Aufgaben schneller und kostengünstiger. Beginnen Sie mit Flash und verlagern Sie spezifische Aufgaben auf Plus, falls die Antworten nicht ausreichen.
Unterstützt Qwen Flash den Denk-Modus?
Ja. Das Denken kann für Anfragen, die schrittweises Reasoning erfordern, eingeschaltet und für einfache Anfragen ausgeschaltet werden. Die Dokumentation von Alibaba führt den Denk-Modus als für dieses Modell unterstützt auf.
Kann Qwen Flash Bilder verarbeiten oder Tools aufrufen?
Nein. Es ist ein Text-in-Text-out-Modell ohne Bildeingabe oder Tool-Calling. Wählen Sie ein Qwen-Vision-Modell oder eine andere Familie, falls die Anfrage eines von beidem erfordert.
Ist Qwen Flash eine gute Wahl für ein neues Projekt?
Bestehende Pipelines können darauf verbleiben, und es bleibt für stabile Hochvolumen-Jobs nutzbar. Für einen neuen Build verweist Alibaba auf neuere Qwen3-Generationen; vergleichen Sie es daher zuerst mit Qwen3.8 Flash.
Was kostet Qwen Flash?
Auf TokenLab kostet Qwen Flash Eingabe $0.05 / Ausgabe $0.40 Pro 1M Token. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welche Kontext- und Ausgabelimits hat Qwen Flash?
Qwen Flash verarbeitet bis zu 997.952 Token Kontext und gibt pro Antwort bis zu 32.768 Token aus.
Welchen Endpunkt soll Qwen Flash verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/responses für Qwen Flash. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Qwen Flash?
Qwen Flash unterstützt Text-zu-Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Qwen Flash vergleichen
Quellen
Geprüft am 02.10.2026