Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash bewältigt lange Textkonversationen und toolgestützte Arbeit. Der Kontext von einer Million Token ist nützlich, wenn ein Assistent eine umfangreiche Dokumentensammlung analysieren oder eine große Codebasis im Blick behalten muss.
Modelle vergleichen
deepseek-v4-flash
VerfügbarDeepSeekUnterhaltung
Eingabe / Ausgabe
$0.15 / $0.60
Kontext
1M
Veröffentlicht
24. Apr. 2026
Maximale Ausgabe
384K
Modalitäten
VisionUnterhaltung
Funktionen
Tool-NutzungPrompt-CacheReasoning

Über DeepSeek V4 Flash

DeepSeek V4 Flash ist das kleinere Modell der V4-Generation von DeepSeek, ein Mixture-of-Experts-Sprachmodell mit offenen Gewichten, das über insgesamt 284 Mrd. Parameter verfügt, von denen 13 Mrd. aktiv sind. DeepSeek positioniert es für Geschwindigkeit und niedrige Betriebskosten, während die Schlussfolgerungsleistung nahe an V4 Pro gehalten wird. Es läuft in Thinking- und Nicht-Thinking-Modi, ruft Tools auf, speichert Prompts im Cache und antwortet auf Anfrage in JSON. Es ist ein reines Textmodell.

Stärken

  • DeepSeek berichtet, dass seine Schlussfolgerungsleistung eng an V4 Pro heranreicht und es bei grundlegenden Agenten-Aufgaben bei einer deutlich geringeren Anzahl aktiver Parameter besteht.
  • Der Thinking-Modus kann pro Anfrage mit niedrigem, hohem oder maximalem Aufwand zugeschaltet werden, sodass ein Modell sowohl schnelle Antworten als auch langsamere Problemlösungen abdeckt.
  • Ein sehr langes Kontextfenster ermöglicht es einem Assistenten, eine große Codebasis oder eine umfangreiche Dokumentensammlung über ein Gespräch hinweg im Blick zu behalten.
  • Es unterstützt Tool-Aufrufe, strukturierte JSON-Ausgabe und Prompt-Caching, was bei langen Agenten-Schleifen hilft, die dieselben Anweisungen wiederholt senden.

Alternativen

  • Es ist ein Textmodell, daher gehören Aufgaben, die Screenshots oder Diagramme beinhalten, zu DeepSeek V4.1 Flash oder der Vision-Exp-Variante.
  • DeepSeek gibt an, dass V4 Pro bei agentischen Coding-Benchmarks und Weltwissen führend ist, weshalb die schwierigsten Programmier- und Forschungsaufgaben besser zu Pro passen.
  • Im Thinking-Modus wird der Schlussfolgerungstext separat zurückgegeben und muss bei späteren Tool-Aufrufen erneut übergeben werden, was der Agenten-Code handhaben muss.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Text-zu-TextResponses API
    POST/v1/responses
    API-Format:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

Preise

Der TokenLab-Preis gilt für Verified und ist bei den meisten Modellen günstiger. Der Official-Preis entspricht dem Standardpreis des Herstellers für die zuverlässigere Route. Auto berechnet jeweils die Route, die deine Anfrage erfolgreich verarbeitet.

Preiszeitraum · Nebenzeit

Pro 1M Token
Offizieller Preis
Eingabe $0.15 / Ausgabe $0.60 / Cache-Lesevorgang $0.003
Official
Eingabe $0.15 / Ausgabe $0.60 / Cache-Lesevorgang $0.003
Rabatt
—

Preiszeitraum · Spitzenzeit

Pro 1M Token
Offizieller Preis
Eingabe $0.30 / Ausgabe $1.20 / Cache-Lesevorgang $0.006
Official
Eingabe $0.30 / Ausgabe $1.20 / Cache-Lesevorgang $0.006
Rabatt
—
Prompt-Cache-Preise

Cache-Lesevorgang

Offizieller Preis
$0.003
Official
$0.003
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Erfolgsquote (30 Tage)
99,5%
Anfragen (30 Tage)
100+
Zuletzt aktiv
vor 16 Stunden

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne DeepSeek V4 Flash in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste deepseek-v4-flash mit einer kurzen Nachricht an /v1/responses. Zeige Antwort, Latenz und Kosten.

Anwendungsfälle

Geeignet für
  • Reasoning
  • Vision
  • Agenten-Schritte mit hohem Volumen

    Verwenden Sie es für die vielen kleinen Entscheidungen innerhalb einer Agenten-Schleife, wie das Auswählen eines Tools, das Lesen des Ergebnisses und das Planen des nächsten Aufrufs, bei denen sich Antwortzeit und Kosten summieren.

  • Fragen zum gesamten Repository

    Fügen Sie eine große Codebasis oder eine Menge von Dokumenten in den langen Kontext ein und fragen Sie, wo ein Verhalten implementiert ist oder welche Dateien eine Änderung betreffen würde.

  • Strukturierte Extraktion

    Wandeln Sie Verträge, Tickets oder Protokolle in JSON um, das einem Schema folgt, wobei der Thinking-Modus deaktiviert ist, damit jeder Datensatz schnell zurückgegeben wird.

  • Direkter Ersatz für ältere DeepSeek-Namen

    Leiten Sie bestehende Clients, die die eingestellten Chat- und Reasoner-Namen verwendeten, auf deepseek-v4-flash um und wählen Sie dann pro Anfrage den Thinking- oder Nicht-Thinking-Modus.

Prompt-Beispiele

Der vollständige Quellcode unseres Abrechnungsdienstes folgt. Welche Module lesen das Feld für den Rechnungsstatus und was geht kaputt, wenn ich einen neuen Status hinzufüge?

Extrahieren Sie jedes Verlängerungsdatum, jede Kündigungsfrist und jede Stornogebühr aus diesen fünf Verträgen und geben Sie ein JSON-Array zurück, das diesem Schema entspricht.

Sie können search_docs und open_ticket aufrufen. Ein Benutzer meldet, dass Webhooks gestern nicht mehr ankamen. Untersuchen Sie dies mit den Tools und fassen Sie dann die wahrscheinliche Ursache zusammen.

Dieses Modell hat konditionale Preise. Monatliche Token-Summen allein liefern keine verlässliche Schätzung; nutzen Sie die detaillierten Preise für Anfragespezifikation, Cache und Zeitfenster.

FAQ

Was ist der Unterschied zwischen DeepSeek V4 Flash und V4 Pro?

Flash ist das kleinere Modell mit 13 Mrd. aktiven Parametern gegenüber 49 Mrd. bei Pro. DeepSeek gibt an, dass Flash fast so gut schlussfolgert wie Pro und bei einfachen Agenten-Aufgaben gleichzieht, während Pro bei agentischem Coding und Weltwissen stärker ist. Beginnen Sie mit Flash und verlagern Sie eine Aufgabe auf Pro, wenn sie fehlschlägt.

Unterstützt DeepSeek V4 Flash den Thinking-Modus?

Ja. Aktivieren Sie Thinking in der Anfrage und wählen Sie einen niedrigen, hohen oder maximalen Schlussfolgerungsaufwand; „hoch“ ist der Standard. Die Schlussfolgerung kommt in einem separaten Feld an, und Konversationen, die Tools nutzen, müssen diese bei jedem folgenden Schritt mitsenden. Lassen Sie Thinking für kurze, latenzempfindliche Antworten deaktiviert.

Kann DeepSeek V4 Flash Bilder lesen?

Nein. Es ist ein Textmodell: Text geht hinein und Text kommt heraus. DeepSeek V4.1 Flash und die V4 Flash Vision-Exp-Variante sind separate Modelle, die Bilder verstehen; verwenden Sie daher eines dieser Modelle, wenn der Prompt Screenshots oder Diagramme enthält.

Wofür ist der lange Kontext nützlich?

Er ermöglicht es einer Anfrage, ein ganzes Repository oder eine Menge von Dokumenten zu enthalten, sodass das Modell beantworten kann, wo ein Verhalten implementiert ist oder welche Dateien eine Änderung betreffen, ohne dass zwischendurch ein Abruf (Retrieval) erforderlich ist. Kombinieren Sie dies mit Prompt-Caching, wenn dasselbe Material wiederholt gesendet wird.

Was ist mit den alten Namen deepseek-chat und deepseek-reasoner passiert?

DeepSeek hat sie am 24. Juli 2026 eingestellt. Während der Übergangsphase wurden sie auf V4 Flash im Nicht-Thinking- und Thinking-Modus abgebildet. Neuer Code sollte deepseek-v4-flash aufrufen und die Thinking-Option setzen, anstatt sich auf separate Namen für jeden Modus zu verlassen.

Was kostet DeepSeek V4 Flash?

Auf TokenLab kostet DeepSeek V4 Flash Eingabe $0.15 / Ausgabe $0.60 Pro 1M Token. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welche Kontext- und Ausgabelimits hat DeepSeek V4 Flash?

DeepSeek V4 Flash verarbeitet bis zu 1.000.000 Token Kontext und gibt pro Antwort bis zu 384.000 Token aus.

Welchen Endpunkt soll DeepSeek V4 Flash verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/responses für DeepSeek V4 Flash. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt DeepSeek V4 Flash?

DeepSeek V4 Flash unterstützt Text-zu-Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

DeepSeek V4 Flash vergleichen

Anleitungen für DeepSeek V4 Flash

Quellen

Geprüft am 02.10.2026

Mehr aus der DeepSeek V4-Serie

Ähnliche Modelle