Alibaba: Qwen3.5-Flash
qwen3.5-flash- Eingabe / Ausgabe
- $0.10 / $0.40
- Kontext
- 992K
- Maximale Ausgabe
- 64K
- Modalitäten
- Unterhaltung
- Funktionen
- Prompt-Cache
Über Qwen3.5-Flash
Qwen3.5-Flash ist die leichtere gehostete Stufe der Qwen3.5-Familie von Alibaba, die für eine schnellere und kostengünstigere Textverarbeitung als Qwen3.5-Plus entwickelt wurde. Sie verfügt über einen sehr großen Kontext und Prompt-Caching, was sich für Zusammenfassungen und wiederholte Durchläufe derselben großen Quelle eignet. Sie teilt die breite Sprachabdeckung der Produktfamilie.
Stärken
- Prompt-Caching unterstützt die wiederholte Abfrage einer großen Quelle.
- Auf Geschwindigkeit optimiert, im Vergleich zur Plus-Stufe.
- Teilt die Abdeckung von 201 Sprachen der Qwen3.5-Familie.
- Gut geeignet für Pipeline-Schritte wie Zusammenfassen oder Tagging.
Alternativen
- Qwen3.5-Plus ist bei schwierigeren Analysen besser.
- Es verarbeitet nur Text und kann daher kein Vision-Modell ersetzen.
- Älter als Qwen3.8-Flash, das Ergebnisse für agentisches Programmieren liefert.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Text-zu-TextResponses APIPOST/v1/responsesAPI-Format:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen3.5-flash", "input": "Hello!" }'
Preise
Der TokenLab-Preis gilt für Verified und ist bei den meisten Modellen günstiger. Der Official-Preis entspricht dem Standardpreis des Herstellers für die zuverlässigere Route. Auto berechnet jeweils die Route, die deine Anfrage erfolgreich verarbeitet.
Eingabe Token <= 125K
Pro 1M Token- Offizieller Preis
- Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40
- Official
- Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40
- Rabatt
- —
Eingabe Token <= 250K
Pro 1M Token- Offizieller Preis
- Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40
- Official
- Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40
- Rabatt
- —
Eingabe Token <= 1M
Pro 1M Token- Offizieller Preis
- Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40
- Official
- Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40
- Rabatt
- —
Cache-Lesevorgang
- Offizieller Preis
- $0.01
- Official
- $0.01
- Rabatt
- —
Cache-Schreibvorgang
- Offizieller Preis
- $0.125
- Official
- $0.125
- Rabatt
- —
| Offizieller PreisPro 1M Token | OfficialPro 1M Token | Rabatt | |
|---|---|---|---|
| Eingabe Token <= 125K | Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40 | Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40 | — |
| Eingabe Token <= 250K | Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40 | Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40 | — |
| Eingabe Token <= 1M | Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40 | Eingabe $0.10 / Ausgabe $0.40 / Cache-Lesevorgang $0.01 / Cache-Schreibvorgang $0.125 / Text Eingabe $0.10 / Text Ausgabe $0.40 | — |
| Prompt-Cache-Preise | |||
| Cache-Lesevorgang | $0.01 | $0.01 | — |
| Cache-Schreibvorgang | $0.125 | $0.125 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Qwen3.5-Flash in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste qwen3.5-flash mit einer kurzen Nachricht an /v1/responses. Zeige Antwort, Latenz und Kosten.
Anwendungsfälle
Stapelverarbeitung von Zusammenfassungen
Fassen Sie lange Berichte in einer nächtlichen Pipeline zusammen, wobei dieselbe große Quelle über die von Ihnen abgefragten Abschnitte hinweg zwischengespeichert wird.
Dokument-Tagging und -Routing
Kategorisieren Sie lange Texte nach Thema, Dringlichkeit oder Verantwortlichem und geben Sie das Ergebnis in einem festen Format zurück, das nachgelagerter Code verarbeiten kann.
Wiederholte Fragen und Antworten zu einer Quelle
Speichern Sie ein Handbuch oder eine Richtlinie einmal zwischen und stellen Sie viele Fragen dazu, ohne bei jedem Durchgang für die erneute Verarbeitung des gesamten Textes zu bezahlen.
Überarbeitung von Entwürfen
Korrigieren Sie Grammatik, Tonfall und Struktur in langen Entwürfen, während die Behauptungen und Zahlen des Autors unangetastet bleiben.
Prompt-Beispiele
Fassen Sie jeden Abschnitt dieses Handbuchs in zwei Zeilen zusammen.
Taggen Sie dieses Ticket mit Produktbereich und Dringlichkeit und geben Sie JSON zurück.
Beantworten Sie Fragen zu der eingefügten Richtlinie; antworten Sie mit 'nicht angegeben', falls diese fehlen.
Dieses Modell hat konditionale Preise. Monatliche Token-Summen allein liefern keine verlässliche Schätzung; nutzen Sie die detaillierten Preise für Anfragespezifikation, Cache und Zeitfenster.
FAQ
Was genau ist Qwen3.5-Flash?
Es ist die leichtere gehostete Stufe der Qwen3.5-Familie von Alibaba, die auf die schnelle Verarbeitung langer Texte ausgerichtet ist. Es liegt in der Leistungsfähigkeit unter Qwen3.5-Plus und ist für wiederholte, routinemäßige Dokumentenschritte gedacht.
Wann sollte ich Flash anstelle von Qwen3.5-Plus wählen?
Wählen Sie Flash, wenn Geschwindigkeit und Kosten wichtiger sind als die Tiefe, wie etwa bei der Massenzusammenfassung, beim Tagging oder bei Fragen und Antworten zu einer festen Quelle. Wechseln Sie zu Plus, wenn Antworten eine sorgfältigere Analyse über viele Passagen hinweg erfordern.
Unterstützt Qwen3.5-Flash Prompt-Caching?
Ja. Prompt-Caching hilft, wenn dieselbe lange Quelle immer wieder gesendet wird, wie bei wiederholten Dokumentenverarbeitungsschritten, bei denen sich zwischen den Aufrufen nur die Frage ändert.
Kann Qwen3.5-Flash Bilder lesen?
Nein. Qwen3.5-Flash verarbeitet nur Text. Verwenden Sie Qwen3.8-Flash, Qwen3.7-Plus oder Qwen3-VL Plus, wenn Screenshots, Scans oder Diagramme Teil der Aufgabe sind, und senden Sie den extrahierten Text stattdessen an dieses Modell.
Gibt es ein neueres Flash-Modell von Alibaba?
Ja. Qwen3.8-Flash ist ein neueres multimodales Mixture-of-Experts-Modell, das auf agentisches Programmieren und langfristige Agentenaufgaben ausgerichtet ist. Behalten Sie Qwen3.5-Flash für reine Text-Pipelines bei, die bereits gut funktionieren.
Was kostet Qwen3.5-Flash?
Auf TokenLab kostet Qwen3.5-Flash Eingabe $0.10 / Ausgabe $0.40 Pro 1M Token. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welche Kontext- und Ausgabelimits hat Qwen3.5-Flash?
Qwen3.5-Flash verarbeitet bis zu 991.808 Token Kontext und gibt pro Antwort bis zu 65.536 Token aus.
Welchen Endpunkt soll Qwen3.5-Flash verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/responses für Qwen3.5-Flash. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Qwen3.5-Flash?
Qwen3.5-Flash unterstützt Text-zu-Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Qwen3.5-Flash vergleichen
Quellen
Geprüft am 02.10.2026