Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Google: Gemini 3.1 Flash-Lite

Modelo Gemini de baja latencia para cargas de trabajo multimodales y de agentes de alto volumen
Comparar modelos
gemini-3.1-flash-lite
DisponibleGoogleChatEntrada en caché 90% más barata
Entrada / Salida-50%
$0.25 / $1.50$0.125 / $0.75
Contexto
1M
Lanzado
7 may 2026
Salida máxima
64K
Modalidades
VisiónChat
Capacidades
Uso de herramientasCaché de prompts

Sobre Gemini 3.1 Flash-Lite

Gemini 3.1 Flash-Lite es el modelo de baja latencia y bajo coste de Google en la línea Gemini 3.1, diseñado para cargas de trabajo multimodales y de agentes de gran volumen. Google describe un rendimiento de clase frontera que rivaliza con modelos más grandes a una fracción del coste. Lee texto e imágenes, llama a herramientas, devuelve JSON vinculado a esquemas y admite almacenamiento en caché de contexto, situándose por debajo del nivel Flash en capacidad.

Puntos fuertes

  • Los tiempos de respuesta cortos lo hacen adecuado para funciones interactivas donde cada llamada debe responder rápidamente.
  • Las imágenes y el texto se incluyen en la misma solicitud, lo que se adapta al procesamiento de recibos, formularios y capturas de pantalla.
  • La salida JSON vinculada a esquemas elimina la necesidad de un análisis frágil de texto libre.
  • La llamada a herramientas y el almacenamiento en caché de contexto admiten pasos de agente repetidos y similares a escala.

Cuándo buscar otra opción

  • Para agentes de codificación largos y de varios pasos, los modelos Flash y Pro funcionan mejor que un modelo Lite.
  • No es un modelo centrado en el razonamiento; las matemáticas complejas o la planificación profunda se envían mejor a Gemini 3.1 Pro.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a textoGemini API
    POST/v1beta/models/gemini-3.1-flash-lite:generateContent
    Formato de API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Precios

El precio Verified se aplica a Verified, que cuesta menos en la mayoría de los modelos. El precio Official es el precio publicado por el fabricante del modelo y se aplica a la ruta Official, más fiable. Auto factura la ruta que completa la solicitud.

Especificación por defecto

Por 1M Token
Precio Official
Entrada $0.25 / Salida $1.50 / Lectura de caché $0.025
Precio Verified
Entrada $0.125 / Salida $0.75 / Lectura de caché $0.0125
Descuento
-50%
Precios de caché de prompt

Lectura de caché

Precio Official
$0.025
Precio Verified
$0.0125
Descuento
-50%
Costos de herramientas

Se cobra por llamada, solo cuando el modelo utiliza la herramienta.

Búsqueda web

Precio Official
$0.014/búsqueda
Precio Verified
$0.007/búsqueda
Descuento
-50%

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Tasa de éxito 30 días
100,0%
Solicitudes 30 días
40K+
Última actividad
hace 3 minutos

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Gemini 3.1 Flash-Lite en Console con un prompt listo para editar o enviar.

Ayúdame a probar gemini-3.1-flash-lite con un mensaje breve en /v1beta/models/gemini-3.1-flash-lite:generateContent. Muestra la respuesta, la latencia y el coste.

Casos de uso

Ideal para
  • Visión
  • Extracción masiva

    Extraiga campos de miles de facturas o formularios y escriba cada resultado como un objeto JSON validado.

  • Moderación y etiquetado de contenido

    Etiquete las cargas y comentarios de los usuarios según una política fija con una justificación de una línea.

  • Capa de enrutamiento

    Decida a qué modelo o herramienta especializada debe ir una solicitud y luego pásela.

  • Asistentes en tiempo real

    Potencie el autocompletado, las respuestas rápidas o los turnos de asistente de voz donde una espera visible perjudicaría la experiencia de la persona que lo utiliza.

Ejemplos de prompts

Extraiga el proveedor, la fecha, el total y la moneda de esta imagen de factura y devuélvalos como JSON.

Etiquete el comentario a continuación como spam, abuso, pregunta o elogio y explique la elección en una frase.

Dado este mensaje de usuario, elija uno de: search_docs, create_ticket, answer_directly. Responda solo con el nombre de la herramienta.

Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.

FAQ

¿Para qué es mejor Gemini 3.1 Flash-Lite?

Trabajos de gran volumen y sensibles a la latencia, como extracción, clasificación, etiquetado, enrutamiento y respuestas multimodales rápidas. Sacrifica algo de profundidad de razonamiento por velocidad y una carga más ligera por llamada.

¿Acepta imágenes?

Sí. El texto y las imágenes se pueden mezclar en una sola solicitud, por lo que puede leer documentos, capturas de pantalla y fotos. Su respuesta vuelve como texto o como JSON que coincide con su esquema.

¿Puede llamar a herramientas?

Sí. Se admite la llamada a funciones, lo que le permite actuar como el agente de primera etapa que elige herramientas para solicitudes simples o reenvía casos difíciles a un modelo más grande.

¿En qué se diferencia de Gemini 3.5 Flash-Lite?

3.5 Flash-Lite es la generación más nueva y a la que Google dirige ahora los nuevos proyectos; 3.1 Flash-Lite es el modelo Lite más antiguo, que sigue siendo estable. Pruebe sus propios prompts en ambos antes de mover el tráfico.

¿Cuánto cuesta Gemini 3.1 Flash-Lite?

En TokenLab, Gemini 3.1 Flash-Lite cuesta Entrada $0.125 / Salida $0.75 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Cuál es la ventana de contexto y el límite de salida de Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite admite hasta 1.048.576 tokens de contexto y genera hasta 65.536 tokens por respuesta.

¿Qué endpoint debe usar Gemini 3.1 Flash-Lite?

Utiliza https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent para Gemini 3.1 Flash-Lite. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Gemini 3.1 Flash-Lite

Guías con Gemini 3.1 Flash-Lite

Fuentes

Revisado el 2 oct 2026

Más de Gemini 3

Modelos relacionados