Recibir un error 404 porque una cadena de modelo cambió es una mala forma de empezar un bucle de agente. Vale la pena integrar la API de Gemini 3.5 Flash en un bucle de agente rápido, pero solo después de confirmar el ID exacto del modelo gemini-3.5-flash en la lista de modelos en vivo. Google Cloud lista Gemini 3.5 Flash a $1.50 por cada millón de tokens de entrada y $9.00 por cada millón de tokens de salida de texto en el nivel Global estándar, con precios Flex/Batch de $0.75 para entrada y $4.50 para salida. Vimos la misma trampa en la fuente: un ID de modelo que funciona hoy puede arrojar un 404 mañana. Las tablas de precios en línea a menudo mezclan precios confirmados por el proveedor con listados de directorios que no han sido verificados. Este recorrido cubre lo que es verificable ahora, lo que no lo es y cómo construir un bucle de agente que no se rompa cuando cambia un ID de modelo.
Puntos clave
- La página de precios de la plataforma de agentes de Google Cloud lista Gemini 3.5 Flash a $1.50/M de tokens de entrada y $9.00/M de tokens de salida en el nivel Global estándar, coincidiendo con el listado del directorio de TokenLab en el momento de la actualización.
- La cadena exacta del modelo a fijar es
gemini-3.5-flash; la página de modelos de la API de Gemini de Google lo lista como un ejemplo de modelo estable. Aun así, confírmelo a través de la lista de modelos en vivo antes de implementar. - Enrutar a través de la API unificada de TokenLab significa que no tiene que codificar una cadena de SDK específica del proveedor; TokenLab asigna un slug de modelo estable a cualquier identificador subyacente que sea válido actualmente.
- Los precios de la competencia en la tabla a continuación (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) provienen solo del directorio de TokenLab. No se suministró ninguna página de precios de proveedor independiente para estos modelos en esta revisión: verifique directamente con OpenAI, Anthropic y DeepSeek antes de presupuestar con ellos.
- No se citan cifras de latencia comparadas (tiempo hasta el primer token, duración completa del bucle de 5 pasos) aquí porque ninguna fue obtenida de forma independiente. Instrumente su propio bucle y mida p50/p95 por paso en lugar de citar números de segunda mano.
- En los bucles de agentes, los tokens de salida suelen dominar el gasto: la tasa de salida de Gemini 3.5 Flash ($9.00/M) es 6 veces su tasa de entrada ($1.50/M), por lo que limitar
max_output_tokenses más importante que recortar la longitud del prompt.
Instantánea de la fuente
| Fuente | Lo que cubre | Fecha observada |
|---|---|---|
| Precios de la plataforma de agentes de Google Cloud | Precios de tokens de Gemini 3.5 Flash estándar, entrada en caché y Flex/Batch | 2026-07-08 |
| Página de modelos de la API de Google Gemini | Guía de nombres de modelos estables; gemini-3.5-flash listado como ejemplo de modelo estable |
2026-07-08 |
| Directorio de modelos y precios de TokenLab | Precios por token para gemini-3.5-flash y modelos de la competencia en Google, Anthropic, OpenAI y DeepSeek |
2026-07-08 |
La plataforma de agentes Gemini Enterprise de Google Cloud lista Gemini 3.5 Flash en su propio programa de precios, separado de la página de precios de la API para desarrolladores de Gemini. Las tarifas globales estándar son de $1.50 por cada 1 millón de tokens de entrada y $9.00 por cada 1 millón de tokens de salida de texto. Las tarifas globales Flex/Batch bajan a $0.75 de entrada y $4.50 de salida. La entrada en caché en el nivel estándar cuesta $0.15 por cada 1 millón de tokens. Esta es una prueba directa de que Gemini 3.5 Flash es un modelo estable y generalmente disponible, con precios para cargas de trabajo de agentes empresariales en Google Cloud, no un marcador de posición o etiqueta de vista previa. Los lectores que comparen costos entre artículos deben verificar de qué página de precios se obtuvo una tarifa antes de tratar los números como intercambiables.
Comparación de modelos y costos para la API de Gemini 3.5 Flash
Todas las cifras a continuación son listados del directorio de TokenLab. Las filas marcadas como 'verificar con el proveedor' no tienen ninguna cita independiente suministrada para esta revisión.
| Modelo | Proveedor | Ventana de contexto | Entrada $/M tokens | Salida $/M tokens | Nota |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1,048,576 | $1.50 | $9.00 | Directorio de TokenLab; verificar con la página de precios en vivo de Google | |
| gemini-3.1-flash-lite | n/a | $0.25 | $1.50 | Directorio de TokenLab | |
| gemini-3-pro-image | n/a | $2.00 | $12.00 | Directorio de TokenLab, nivel de imagen; no usar como sustituto de agente de texto | |
| gpt-5 | OpenAI | n/a | $1.25 | $10.00 | Directorio de TokenLab |
| gpt-5.5 | OpenAI | 1,050,000 | $5.00 | $30.00 | Directorio de TokenLab - verificar con OpenAI |
| claude-sonnet-5 | Anthropic | 1,000,000 | $2.00 | $10.00 | Directorio de TokenLab - verificar con Anthropic |
| claude-haiku-4-5 | Anthropic | n/a | $1.00 | $5.00 | Directorio de TokenLab |
| deepseek-v4-flash | DeepSeek | 1,048,576 | $0.09 | $0.18 | Directorio de TokenLab - verificar con DeepSeek |
Para los bucles de agentes que realizan muchos turnos pequeños de llamadas a herramientas, la tarifa por token más barata no siempre es la tarifa por tarea más barata: un modelo que necesita menos reintentos o trazas de razonamiento más cortas puede superar un precio de lista más bajo. Mida el costo por tarea completada, no solo el costo por token.
Pasos de implementación para la API de Gemini 3.5 Flash
Confirme el ID del modelo antes de escribir código. En el momento de la actualización, el ID del modelo a fijar era
gemini-3.5-flash, y los documentos de modelos de Google lo listan como un ejemplo de modelo estable. Aun así, llame al endpoint de lista de modelos de su proveedor o consulte el directorio de TokenLab antes de la implementación. Esta es la solución para el problema de 'el SDK arrojó un error': la cadena no existía en el momento de la llamada. Ninguna cantidad de lógica de reintento soluciona un identificador incorrecto. Por ejemplo, la fuente describe ese modo de falla directamente.Enrute a través de un endpoint unificado en lugar de un SDK de proveedor sin procesar. Usar TokenLab (o una puerta de enlace similar) significa que el código de su aplicación hace referencia a un slug estable, y la puerta de enlace lo resuelve al identificador válido actual del proveedor. Esto desacopla su bucle de agente de los cambios de nombre o depreciaciones de modelos por parte del proveedor.
Construya el bucle con pasos explícitos e instrumentación:
# Estructura ilustrativa solamente - confirme el endpoint/modelo exacto
# contra los documentos actuales de su puerta de enlace antes de implementar.
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
En nuestra canalización, registramos los timings por ejecución y calculamos nuestro propio p50/p95 en un lote representativo de tareas. No publique ni confíe en un número fijo de 'N segundos por bucle' extraído del entorno de otra persona: las condiciones de la red, la longitud del prompt y la carga del proveedor alteran estos números.
Limite los tokens de salida deliberadamente. Los tokens de salida cuestan aproximadamente 6 veces más que los tokens de entrada para
gemini-3.5-flashsegún los precios del directorio anteriores. Probamos las matemáticas de precios. Establezcamax_output_tokenspor paso en lugar de dejar que el modelo se ejecute durante mucho tiempo. Esto es lo más importante en el paso de síntesis, donde las respuestas detalladas son comunes.Agregue una cadena de respaldo. Configure un modelo secundario (por ejemplo,
gemini-3.1-flash-litepor costo, o un proveedor diferente por completo) para que una sola interrupción o depreciación del modelo no elimine a todo su agente.
Cuándo usar TokenLab
- Desea un slug de modelo estable en lugar de una cadena de proveedor frágil. El enfoque de directorio de TokenLab significa que su código no necesita ser reescrito cada vez que un proveedor cambia el nombre o deprecia un modelo. El cierre del propio Veo 3.0 de Google está programado para el 30 de junio de 2026, lo que muestra el riesgo.
- Necesita un lugar para comparar costos entre proveedores antes de comprometerse con un proveedor, en lugar de verificar manualmente cuatro páginas de precios separadas cada vez que evalúa un cambio de modelo.
- Está ejecutando lógica de respaldo de múltiples proveedores y desea una forma de solicitud/respuesta consistente en los modelos de Google, Anthropic, OpenAI y DeepSeek en lugar de mantener cuatro integraciones de SDK separadas.
Lecturas relacionadas
Preguntas frecuentes
¿Es gemini-3.5-flash un ID de modelo válido que puedo llamar directamente contra el SDK de Google?
No lo asuma. Confírmelo contra la lista de modelos actual de Google antes de implementar: las cadenas de ID de modelo cambian y el estado de vista previa/GA cambia con el tiempo. Si está enrutando a través de TokenLab, la puerta de enlace maneja esta asignación por usted.
¿De dónde provienen los precios de la competencia en la tabla comparativa?
Son listados del directorio de TokenLab. Solo los precios de video de Veo en este artículo se remontan a una fuente de Google con fecha independiente (observada el 2026-07-08). Los precios de GPT-5.5, Claude Sonnet 5 y DeepSeek V4 Flash aquí no tienen ninguna cita independiente suministrada: verifique con cada proveedor antes de usar estos números en una estimación de costos orientada al cliente.
¿Qué tan rápido es un bucle de agente de Gemini 3.5 Flash de 5 pasos?
No se incluye ninguna cifra comparada aquí porque ninguna fue obtenida de forma independiente para este artículo. Instrumente su propio bucle (vea el ejemplo de código anterior) y mida la latencia p50/p95 real en su entorno en lugar de confiar en un número de segunda mano.
¿Qué sucede si el modelo que estoy usando se deprecia a mitad del proyecto?
Este es exactamente el escenario que ilustra el cierre de Veo 3.0 de Google (30 de junio de 2026). Construya una cadena de respaldo y, donde sea posible, enrute a través de una puerta de enlace que mantenga slugs de modelo actualizados para que una depreciación no requiera una reescritura de código.
Cree una clave de API de TokenLab para comparar los ID de modelo actuales antes de implementar.
Fuentes
Precio observado el 2026-07-08
- Google AI Gemini API pricingObservado el 2026-07-08
- Google Cloud Agent Platform pricingObservado el 2026-07-08
- Google Gemini API modelsObservado el 2026-07-08
- TokenLab model directoryObservado el 2026-07-07



