Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- Entrada / Salida-50%
- $0.25 / $1.50$0.125 / $0.75
- Contexto
- 1M
- Lanzado
- 7 may 2026
- Salida máxima
- 64K
- Modalidades
- VisiónChat
- Capacidades
- Uso de herramientasCaché de prompts
Sobre Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite es el modelo de baja latencia y bajo coste de Google en la línea Gemini 3.1, diseñado para cargas de trabajo multimodales y de agentes de gran volumen. Google describe un rendimiento de clase frontera que rivaliza con modelos más grandes a una fracción del coste. Lee texto e imágenes, llama a herramientas, devuelve JSON vinculado a esquemas y admite almacenamiento en caché de contexto, situándose por debajo del nivel Flash en capacidad.
Puntos fuertes
- Los tiempos de respuesta cortos lo hacen adecuado para funciones interactivas donde cada llamada debe responder rápidamente.
- Las imágenes y el texto se incluyen en la misma solicitud, lo que se adapta al procesamiento de recibos, formularios y capturas de pantalla.
- La salida JSON vinculada a esquemas elimina la necesidad de un análisis frágil de texto libre.
- La llamada a herramientas y el almacenamiento en caché de contexto admiten pasos de agente repetidos y similares a escala.
Cuándo buscar otra opción
- Para agentes de codificación largos y de varios pasos, los modelos Flash y Pro funcionan mejor que un modelo Lite.
- No es un modelo centrado en el razonamiento; las matemáticas complejas o la planificación profunda se envían mejor a Gemini 3.1 Pro.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a textoGemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentFormato de API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Precios
El precio Verified se aplica a Verified, que cuesta menos en la mayoría de los modelos. El precio Official es el precio publicado por el fabricante del modelo y se aplica a la ruta Official, más fiable. Auto factura la ruta que completa la solicitud.
Especificación por defecto
Por 1M Token- Precio Official
- Entrada $0.25 / Salida $1.50 / Lectura de caché $0.025
- Precio Verified
- Entrada $0.125 / Salida $0.75 / Lectura de caché $0.0125
- Descuento
- -50%
Lectura de caché
- Precio Official
- $0.025
- Precio Verified
- $0.0125
- Descuento
- -50%
Se cobra por llamada, solo cuando el modelo utiliza la herramienta.
Búsqueda web
- Precio Official
- $0.014/búsqueda
- Precio Verified
- $0.007/búsqueda
- Descuento
- -50%
| Precio OfficialPor 1M Token | Precio VerifiedPor 1M Token | Descuento | |
|---|---|---|---|
| Especificación por defecto | Entrada $0.25 / Salida $1.50 / Lectura de caché $0.025 | Entrada $0.125 / Salida $0.75 / Lectura de caché $0.0125 | -50% |
| Precios de caché de prompt | |||
| Lectura de caché | $0.025 | $0.0125 | -50% |
| Costos de herramientasSe cobra por llamada, solo cuando el modelo utiliza la herramienta. | |||
| Búsqueda web | $0.014/búsqueda | $0.007/búsqueda | -50% |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
- Tasa de éxito 30 días
- 100,0%
- Solicitudes 30 días
- 40K+
- Última actividad
- hace 3 minutos
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Gemini 3.1 Flash-Lite en Console con un prompt listo para editar o enviar.
Ayúdame a probar gemini-3.1-flash-lite con un mensaje breve en /v1beta/models/gemini-3.1-flash-lite:generateContent. Muestra la respuesta, la latencia y el coste.
Casos de uso
Ideal para- Visión
Extracción masiva
Extraiga campos de miles de facturas o formularios y escriba cada resultado como un objeto JSON validado.
Moderación y etiquetado de contenido
Etiquete las cargas y comentarios de los usuarios según una política fija con una justificación de una línea.
Capa de enrutamiento
Decida a qué modelo o herramienta especializada debe ir una solicitud y luego pásela.
Asistentes en tiempo real
Potencie el autocompletado, las respuestas rápidas o los turnos de asistente de voz donde una espera visible perjudicaría la experiencia de la persona que lo utiliza.
Ejemplos de prompts
Extraiga el proveedor, la fecha, el total y la moneda de esta imagen de factura y devuélvalos como JSON.
Etiquete el comentario a continuación como spam, abuso, pregunta o elogio y explique la elección en una frase.
Dado este mensaje de usuario, elija uno de: search_docs, create_ticket, answer_directly. Responda solo con el nombre de la herramienta.
Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.
FAQ
¿Para qué es mejor Gemini 3.1 Flash-Lite?
Trabajos de gran volumen y sensibles a la latencia, como extracción, clasificación, etiquetado, enrutamiento y respuestas multimodales rápidas. Sacrifica algo de profundidad de razonamiento por velocidad y una carga más ligera por llamada.
¿Acepta imágenes?
Sí. El texto y las imágenes se pueden mezclar en una sola solicitud, por lo que puede leer documentos, capturas de pantalla y fotos. Su respuesta vuelve como texto o como JSON que coincide con su esquema.
¿Puede llamar a herramientas?
Sí. Se admite la llamada a funciones, lo que le permite actuar como el agente de primera etapa que elige herramientas para solicitudes simples o reenvía casos difíciles a un modelo más grande.
¿En qué se diferencia de Gemini 3.5 Flash-Lite?
3.5 Flash-Lite es la generación más nueva y a la que Google dirige ahora los nuevos proyectos; 3.1 Flash-Lite es el modelo Lite más antiguo, que sigue siendo estable. Pruebe sus propios prompts en ambos antes de mover el tráfico.
¿Cuánto cuesta Gemini 3.1 Flash-Lite?
En TokenLab, Gemini 3.1 Flash-Lite cuesta Entrada $0.125 / Salida $0.75 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Cuál es la ventana de contexto y el límite de salida de Gemini 3.1 Flash-Lite?
Gemini 3.1 Flash-Lite admite hasta 1.048.576 tokens de contexto y genera hasta 65.536 tokens por respuesta.
¿Qué endpoint debe usar Gemini 3.1 Flash-Lite?
Utiliza https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent para Gemini 3.1 Flash-Lite. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Gemini 3.1 Flash-Lite?
Gemini 3.1 Flash-Lite admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Gemini 3.1 Flash-Lite
Guías con Gemini 3.1 Flash-Lite
Fuentes
Revisado el 2 oct 2026