Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Google: Gemini 3.1 Flash-Lite

Gemini-Modell mit geringer Latenz für multimodale Workloads und Agenten-Workloads mit hohem Volumen
Modelle vergleichen
gemini-3.1-flash-lite
VerfügbarGoogleUnterhaltung90% Rabatt bei Cache-Nutzung
Eingabe / Ausgabe-50%
$0.25 / $1.50$0.125 / $0.75
Kontext
1M
Veröffentlicht
7. Mai 2026
Maximale Ausgabe
64K
Modalitäten
VisionUnterhaltung
Funktionen
Tool-NutzungPrompt-Cache

Über Gemini 3.1 Flash-Lite

Gemini 3.1 Flash-Lite ist Googles Modell mit niedriger Latenz und geringen Kosten aus der Gemini 3.1-Reihe, das für multimodale Workloads und Agenten-Workflows mit hohem Volumen entwickelt wurde. Google beschreibt eine Leistung auf Frontier-Niveau, die mit größeren Modellen zu einem Bruchteil der Kosten konkurriert. Es liest Text und Bilder, ruft Tools auf, gibt schema-gebundenes JSON zurück, unterstützt Kontext-Caching und liegt in der Leistungsfähigkeit unter der Flash-Stufe.

Stärken

  • Kurze Antwortzeiten machen es geeignet für interaktive Funktionen, bei denen jeder Aufruf schnell reagieren muss.
  • Bilder und Text fließen in dieselbe Anfrage ein, was sich für die Verarbeitung von Belegen, Formularen und Screenshots eignet.
  • Schema-gebundene JSON-Ausgabe macht das fehleranfällige Parsen von freiem Text überflüssig.
  • Tool-Aufrufe und Kontext-Caching unterstützen wiederholte, ähnliche Agentenschritte in großem Maßstab.

Alternativen

  • Für lange, mehrstufige Coding-Agenten sind die Flash- und Pro-Modelle besser geeignet als ein Lite-Modell.
  • Es ist kein Modell, das auf Schlussfolgerungen spezialisiert ist; komplexe Mathematik oder tiefgreifende Planung sollten besser an Gemini 3.1 Pro gesendet werden.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Text-zu-TextGemini API
    POST/v1beta/models/gemini-3.1-flash-lite:generateContent
    API-Format:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Preise

Der Verified-Preis gilt für Verified und ist bei den meisten Modellen günstiger. Der Official-Preis ist der veröffentlichte Preis des Modellherstellers und gilt für die zuverlässigere Official-Route. Auto rechnet die Route ab, die die Anfrage abschließt.

Standardspezifikation

Pro 1M Token
Official-Preis
Eingabe $0.25 / Ausgabe $1.50 / Cache-Lesevorgang $0.025
Verified-Preis
Eingabe $0.125 / Ausgabe $0.75 / Cache-Lesevorgang $0.0125
Rabatt
-50%
Prompt-Cache-Preise

Cache-Lesevorgang

Official-Preis
$0.025
Verified-Preis
$0.0125
Rabatt
-50%
Tool-Gebühren

Die Abrechnung erfolgt pro Aufruf, nur wenn das Modell das Tool verwendet.

Websuche

Official-Preis
$0.014/Suche
Verified-Preis
$0.007/Suche
Rabatt
-50%

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Erfolgsquote (30 Tage)
100,0%
Anfragen (30 Tage)
40K+
Zuletzt aktiv
vor 18 Minuten

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Gemini 3.1 Flash-Lite in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste gemini-3.1-flash-lite mit einer kurzen Nachricht an /v1beta/models/gemini-3.1-flash-lite:generateContent. Zeige Antwort, Latenz und Kosten.

Anwendungsfälle

Geeignet für
  • Vision
  • Massenextraktion

    Extrahieren Sie Felder aus tausenden Rechnungen oder Formularen und schreiben Sie jedes Ergebnis als validiertes JSON-Objekt.

  • Inhaltsmoderation und Tagging

    Kategorisieren Sie Benutzer-Uploads und Kommentare anhand einer festen Richtlinie mit einer einzeiligen Begründung.

  • Routing-Ebene

    Entscheiden Sie, an welches spezialisierte Modell oder Tool eine Anfrage weitergeleitet werden soll, und leiten Sie diese dann weiter.

  • Echtzeit-Assistenten

    Unterstützen Sie Autovervollständigung, schnelle Antworten oder Sprachassistenten-Dialoge, bei denen eine sichtbare Wartezeit das Nutzererlebnis beeinträchtigen würde.

Prompt-Beispiele

Extrahiere Anbieter, Datum, Gesamtbetrag und Währung aus diesem Rechnungsbild und gib sie als JSON zurück.

Markiere den folgenden Kommentar als Spam, Missbrauch, Frage oder Lob und erkläre die Wahl in einem Satz.

Wähle basierend auf dieser Benutzernachricht eine der folgenden Optionen: search_docs, create_ticket, answer_directly. Antworte nur mit dem Tool-Namen.

Dieses Modell hat konditionale Preise. Monatliche Token-Summen allein liefern keine verlässliche Schätzung; nutzen Sie die detaillierten Preise für Anfragespezifikation, Cache und Zeitfenster.

FAQ

Wofür eignet sich Gemini 3.1 Flash-Lite am besten?

Für Aufgaben mit hohem Volumen und Latenzanforderungen wie Extraktion, Klassifizierung, Tagging, Routing und schnelle multimodale Antworten. Es tauscht etwas Tiefe bei Schlussfolgerungen gegen Geschwindigkeit und eine geringere Last pro Aufruf.

Akzeptiert es Bilder?

Ja. Text und Bilder können in einer Anfrage gemischt werden, sodass es Dokumente, Screenshots und Fotos lesen kann. Die Antwort erfolgt als Text oder als JSON, das Ihrem Schema entspricht.

Kann es Tools aufrufen?

Ja. Funktionsaufrufe werden unterstützt, wodurch es als erststufiger Agent fungieren kann, der Tools für einfache Anfragen auswählt oder schwierige Fälle an ein größeres Modell weiterleitet.

Wie unterscheidet es sich von Gemini 3.5 Flash-Lite?

3.5 Flash-Lite ist die neuere Generation, auf die Google nun bei neuen Projekten verweist; 3.1 Flash-Lite ist das ältere Lite-Modell, das weiterhin stabil ist. Testen Sie Ihre Prompts auf beiden Modellen, bevor Sie den Datenverkehr umstellen.

Was kostet Gemini 3.1 Flash-Lite?

Auf TokenLab kostet Gemini 3.1 Flash-Lite Eingabe $0.125 / Ausgabe $0.75 Pro 1M Token. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welche Kontext- und Ausgabelimits hat Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite verarbeitet bis zu 1.048.576 Token Kontext und gibt pro Antwort bis zu 65.536 Token aus.

Welchen Endpunkt soll Gemini 3.1 Flash-Lite verwenden?

Verwenden Sie https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent für Gemini 3.1 Flash-Lite. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite unterstützt Text-zu-Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Gemini 3.1 Flash-Lite vergleichen

Anleitungen für Gemini 3.1 Flash-Lite

Quellen

Geprüft am 02.10.2026

Mehr aus der Gemini 3-Serie

Ähnliche Modelle