Google: Gemma 4 31B
gemma-4-31b- Entrada / Salida
- $0.102 / $0.297
- Modalidades
- Chat
Sobre Gemma 4 31B
Gemma 4 31B es el modelo denso más grande de la familia Gemma 4 de Google, de pesos abiertos, lanzada en marzo de 2026 en tamaños que van desde E2B hasta 31B. Google describe esta familia como diseñada para el razonamiento, flujos de trabajo agentes, codificación y comprensión multimodal. A diferencia de los modelos propietarios Gemini, sus pesos son públicos, por lo que el mismo modelo puede ejecutarse en su propio hardware.
Puntos fuertes
- Los pesos abiertos le permiten trasladar el mismo modelo entre configuraciones alojadas y de ejecución propia.
- El tamaño denso de 31B apunta a una calidad de razonamiento y codificación que los tamaños más pequeños de Gemma 4 sacrifican.
- La ficha técnica de Google reporta resultados sólidos en benchmarks de razonamiento y codificación como MMLU Pro y LiveCodeBench v6.
- Cobertura multilingüe en más de 140 idiomas.
Cuándo buscar otra opción
- Funciona solo con texto y no tiene llamadas a herramientas, por lo que los flujos de trabajo de agentes están mejor atendidos por un modelo Gemini.
- Es menos capaz que los modelos Gemini 3.x Pro y Flash en tareas autónomas largas.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a textoChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "gemma-4-31b", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Especificación por defecto
Por 1M Token- Precio Official
- Entrada $0.102 / Salida $0.297 / Lectura de caché $0.012
- Official
- Entrada $0.102 / Salida $0.297 / Lectura de caché $0.012
- Descuento
- —
Lectura de caché
- Precio Official
- $0.012
- Official
- $0.012
- Descuento
- —
| Precio OfficialPor 1M Token | OfficialPor 1M Token | Descuento | |
|---|---|---|---|
| Especificación por defecto | Entrada $0.102 / Salida $0.297 / Lectura de caché $0.012 | Entrada $0.102 / Salida $0.297 / Lectura de caché $0.012 | — |
| Precios de caché de prompt | |||
| Lectura de caché | $0.012 | $0.012 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Gemma 4 31B en Console con un prompt listo para editar o enviar.
Ayúdame a probar gemma-4-31b con un mensaje breve en /v1/chat/completions. Muestra la respuesta, la latencia y el coste.
Casos de uso
Asistente autohospedable
Realice prototipos con el modelo alojado y luego muévase a sus propias GPU si las normas de datos lo requieren.
Chat multilingüe
Responda a los usuarios en muchos idiomas desde un solo modelo, lo que mantiene las herramientas de soporte más simples que ejecutar traductores separados.
Explicación de código
Revise fragmentos y escriba funciones en entornos donde un modelo de pesos abiertos es un requisito por razones de política o alojamiento.
Base para ajuste fino (fine-tuning)
Compare una línea base alojada antes de adaptar los pesos abiertos a su dominio.
Ejemplos de prompts
Traduce este párrafo al español, alemán y japonés, y señala cualquier modismo que hayas tenido que parafrasear.
Explica qué hace esta consulta SQL y luego reescríbela para evitar la subconsulta correlacionada.
Escribe una respuesta breve y educada rechazando esta solicitud de reunión y proponiendo la próxima semana.
Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.
FAQ
¿Es Gemma 4 31B de código abierto?
Google publica los pesos bajo los términos de Gemma, lo que lo convierte en un modelo de pesos abiertos. Lea la licencia en la ficha del modelo antes de usarlo comercialmente, ya que es la licencia propia de Gemma.
¿En qué se diferencia Gemma de Gemini?
Los modelos Gemini son la línea propietaria alojada de Google. Los modelos Gemma son modelos más pequeños de pesos abiertos construidos a partir de investigaciones relacionadas, que puede descargar, ajustar y ejecutar usted mismo.
¿Admite llamadas a herramientas?
No. El modelo alojado solo maneja chat de texto, con entrada y salida de texto y sin llamadas a herramientas. Para agentes que llaman a funciones, utilice un modelo Gemini en su lugar.
¿Qué tamaño tiene el modelo?
Aproximadamente 31 mil millones de parámetros, denso, el más grande de los cinco tamaños de Gemma 4: E2B, E4B, 12B, 26B, A4B y 31B. Los tamaños más pequeños están dirigidos a teléfonos y portátiles.
¿Cuánto cuesta Gemma 4 31B?
En TokenLab, Gemma 4 31B cuesta Entrada $0.102 / Salida $0.297 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Qué endpoint debe usar Gemma 4 31B?
Utiliza https://api.tokenlab.sh/v1/chat/completions para Gemma 4 31B. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Gemma 4 31B?
Gemma 4 31B admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Gemma 4 31B
Fuentes
Revisado el 2 oct 2026