Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- Eingabe / Ausgabe-50%
- $0.25 / $1.50$0.125 / $0.75
- Kontext
- 1M
- Veröffentlicht
- 7. Mai 2026
- Maximale Ausgabe
- 64K
- Modalitäten
- VisionUnterhaltung
- Funktionen
- Tool-NutzungPrompt-Cache
Über Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite ist Googles Modell mit niedriger Latenz und geringen Kosten aus der Gemini 3.1-Reihe, das für multimodale Workloads und Agenten-Workflows mit hohem Volumen entwickelt wurde. Google beschreibt eine Leistung auf Frontier-Niveau, die mit größeren Modellen zu einem Bruchteil der Kosten konkurriert. Es liest Text und Bilder, ruft Tools auf, gibt schema-gebundenes JSON zurück, unterstützt Kontext-Caching und liegt in der Leistungsfähigkeit unter der Flash-Stufe.
Stärken
- Kurze Antwortzeiten machen es geeignet für interaktive Funktionen, bei denen jeder Aufruf schnell reagieren muss.
- Bilder und Text fließen in dieselbe Anfrage ein, was sich für die Verarbeitung von Belegen, Formularen und Screenshots eignet.
- Schema-gebundene JSON-Ausgabe macht das fehleranfällige Parsen von freiem Text überflüssig.
- Tool-Aufrufe und Kontext-Caching unterstützen wiederholte, ähnliche Agentenschritte in großem Maßstab.
Alternativen
- Für lange, mehrstufige Coding-Agenten sind die Flash- und Pro-Modelle besser geeignet als ein Lite-Modell.
- Es ist kein Modell, das auf Schlussfolgerungen spezialisiert ist; komplexe Mathematik oder tiefgreifende Planung sollten besser an Gemini 3.1 Pro gesendet werden.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Text-zu-TextGemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentAPI-Format:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Preise
Der Verified-Preis gilt für Verified und ist bei den meisten Modellen günstiger. Der Official-Preis ist der veröffentlichte Preis des Modellherstellers und gilt für die zuverlässigere Official-Route. Auto rechnet die Route ab, die die Anfrage abschließt.
Standardspezifikation
Pro 1M Token- Official-Preis
- Eingabe $0.25 / Ausgabe $1.50 / Cache-Lesevorgang $0.025
- Verified-Preis
- Eingabe $0.125 / Ausgabe $0.75 / Cache-Lesevorgang $0.0125
- Rabatt
- -50%
Cache-Lesevorgang
- Official-Preis
- $0.025
- Verified-Preis
- $0.0125
- Rabatt
- -50%
Die Abrechnung erfolgt pro Aufruf, nur wenn das Modell das Tool verwendet.
Websuche
- Official-Preis
- $0.014/Suche
- Verified-Preis
- $0.007/Suche
- Rabatt
- -50%
| Official-PreisPro 1M Token | Verified-PreisPro 1M Token | Rabatt | |
|---|---|---|---|
| Standardspezifikation | Eingabe $0.25 / Ausgabe $1.50 / Cache-Lesevorgang $0.025 | Eingabe $0.125 / Ausgabe $0.75 / Cache-Lesevorgang $0.0125 | -50% |
| Prompt-Cache-Preise | |||
| Cache-Lesevorgang | $0.025 | $0.0125 | -50% |
| Tool-GebührenDie Abrechnung erfolgt pro Aufruf, nur wenn das Modell das Tool verwendet. | |||
| Websuche | $0.014/Suche | $0.007/Suche | -50% |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
- Erfolgsquote (30 Tage)
- 100,0%
- Anfragen (30 Tage)
- 40K+
- Zuletzt aktiv
- vor 18 Minuten
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Gemini 3.1 Flash-Lite in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste gemini-3.1-flash-lite mit einer kurzen Nachricht an /v1beta/models/gemini-3.1-flash-lite:generateContent. Zeige Antwort, Latenz und Kosten.
Anwendungsfälle
Geeignet für- Vision
Massenextraktion
Extrahieren Sie Felder aus tausenden Rechnungen oder Formularen und schreiben Sie jedes Ergebnis als validiertes JSON-Objekt.
Inhaltsmoderation und Tagging
Kategorisieren Sie Benutzer-Uploads und Kommentare anhand einer festen Richtlinie mit einer einzeiligen Begründung.
Routing-Ebene
Entscheiden Sie, an welches spezialisierte Modell oder Tool eine Anfrage weitergeleitet werden soll, und leiten Sie diese dann weiter.
Echtzeit-Assistenten
Unterstützen Sie Autovervollständigung, schnelle Antworten oder Sprachassistenten-Dialoge, bei denen eine sichtbare Wartezeit das Nutzererlebnis beeinträchtigen würde.
Prompt-Beispiele
Extrahiere Anbieter, Datum, Gesamtbetrag und Währung aus diesem Rechnungsbild und gib sie als JSON zurück.
Markiere den folgenden Kommentar als Spam, Missbrauch, Frage oder Lob und erkläre die Wahl in einem Satz.
Wähle basierend auf dieser Benutzernachricht eine der folgenden Optionen: search_docs, create_ticket, answer_directly. Antworte nur mit dem Tool-Namen.
Dieses Modell hat konditionale Preise. Monatliche Token-Summen allein liefern keine verlässliche Schätzung; nutzen Sie die detaillierten Preise für Anfragespezifikation, Cache und Zeitfenster.
FAQ
Wofür eignet sich Gemini 3.1 Flash-Lite am besten?
Für Aufgaben mit hohem Volumen und Latenzanforderungen wie Extraktion, Klassifizierung, Tagging, Routing und schnelle multimodale Antworten. Es tauscht etwas Tiefe bei Schlussfolgerungen gegen Geschwindigkeit und eine geringere Last pro Aufruf.
Akzeptiert es Bilder?
Ja. Text und Bilder können in einer Anfrage gemischt werden, sodass es Dokumente, Screenshots und Fotos lesen kann. Die Antwort erfolgt als Text oder als JSON, das Ihrem Schema entspricht.
Kann es Tools aufrufen?
Ja. Funktionsaufrufe werden unterstützt, wodurch es als erststufiger Agent fungieren kann, der Tools für einfache Anfragen auswählt oder schwierige Fälle an ein größeres Modell weiterleitet.
Wie unterscheidet es sich von Gemini 3.5 Flash-Lite?
3.5 Flash-Lite ist die neuere Generation, auf die Google nun bei neuen Projekten verweist; 3.1 Flash-Lite ist das ältere Lite-Modell, das weiterhin stabil ist. Testen Sie Ihre Prompts auf beiden Modellen, bevor Sie den Datenverkehr umstellen.
Was kostet Gemini 3.1 Flash-Lite?
Auf TokenLab kostet Gemini 3.1 Flash-Lite Eingabe $0.125 / Ausgabe $0.75 Pro 1M Token. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welche Kontext- und Ausgabelimits hat Gemini 3.1 Flash-Lite?
Gemini 3.1 Flash-Lite verarbeitet bis zu 1.048.576 Token Kontext und gibt pro Antwort bis zu 65.536 Token aus.
Welchen Endpunkt soll Gemini 3.1 Flash-Lite verwenden?
Verwenden Sie https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent für Gemini 3.1 Flash-Lite. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Gemini 3.1 Flash-Lite?
Gemini 3.1 Flash-Lite unterstützt Text-zu-Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Gemini 3.1 Flash-Lite vergleichen
Anleitungen für Gemini 3.1 Flash-Lite
Quellen
Geprüft am 02.10.2026