Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

API de Gemini 3.5 Flash para bucles de agentes rápidos

·19 de septiembre de 2026·9 min de lectura·Actualizado 26 de septiembre de 2026·1517 vistas
#programación#API de IA#TokenLab
API de Gemini 3.5 Flash para bucles de agentes rápidos

Recibir un error 404 porque una cadena de modelo cambió es una mala forma de empezar un bucle de agente. Vale la pena integrar la API de Gemini 3.5 Flash en un bucle de agente rápido, pero solo después de confirmar el ID exacto del modelo gemini-3.5-flash en la lista de modelos en vivo. Google Cloud lista Gemini 3.5 Flash a $1.50 por cada millón de tokens de entrada y $9.00 por cada millón de tokens de salida de texto en el nivel Global estándar, con precios Flex/Batch de $0.75 para entrada y $4.50 para salida. Vimos la misma trampa en la fuente: un ID de modelo que funciona hoy puede arrojar un 404 mañana. Las tablas de precios en línea a menudo mezclan precios confirmados por el proveedor con listados de directorios que no han sido verificados. Este recorrido cubre lo que es verificable ahora, lo que no lo es y cómo construir un bucle de agente que no se rompa cuando cambia un ID de modelo.

Puntos clave

  • La página de precios de la plataforma de agentes de Google Cloud lista Gemini 3.5 Flash a $1.50/M de tokens de entrada y $9.00/M de tokens de salida en el nivel Global estándar, coincidiendo con el listado del directorio de TokenLab en el momento de la actualización.
  • La cadena exacta del modelo a fijar es gemini-3.5-flash; la página de modelos de la API de Gemini de Google lo lista como un ejemplo de modelo estable. Aun así, confírmelo a través de la lista de modelos en vivo antes de implementar.
  • Enrutar a través de la API unificada de TokenLab significa que no tiene que codificar una cadena de SDK específica del proveedor; TokenLab asigna un slug de modelo estable a cualquier identificador subyacente que sea válido actualmente.
  • Los precios de la competencia en la tabla a continuación (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) provienen solo del directorio de TokenLab. No se suministró ninguna página de precios de proveedor independiente para estos modelos en esta revisión: verifique directamente con OpenAI, Anthropic y DeepSeek antes de presupuestar con ellos.
  • No se citan cifras de latencia comparadas (tiempo hasta el primer token, duración completa del bucle de 5 pasos) aquí porque ninguna fue obtenida de forma independiente. Instrumente su propio bucle y mida p50/p95 por paso en lugar de citar números de segunda mano.
  • En los bucles de agentes, los tokens de salida suelen dominar el gasto: la tasa de salida de Gemini 3.5 Flash ($9.00/M) es 6 veces su tasa de entrada ($1.50/M), por lo que limitar max_output_tokens es más importante que recortar la longitud del prompt.

Instantánea de la fuente

Fuente Lo que cubre Fecha observada
Precios de la plataforma de agentes de Google Cloud Precios de tokens de Gemini 3.5 Flash estándar, entrada en caché y Flex/Batch 2026-07-08
Página de modelos de la API de Google Gemini Guía de nombres de modelos estables; gemini-3.5-flash listado como ejemplo de modelo estable 2026-07-08
Directorio de modelos y precios de TokenLab Precios por token para gemini-3.5-flash y modelos de la competencia en Google, Anthropic, OpenAI y DeepSeek 2026-07-08

La plataforma de agentes Gemini Enterprise de Google Cloud lista Gemini 3.5 Flash en su propio programa de precios, separado de la página de precios de la API para desarrolladores de Gemini. Las tarifas globales estándar son de $1.50 por cada 1 millón de tokens de entrada y $9.00 por cada 1 millón de tokens de salida de texto. Las tarifas globales Flex/Batch bajan a $0.75 de entrada y $4.50 de salida. La entrada en caché en el nivel estándar cuesta $0.15 por cada 1 millón de tokens. Esta es una prueba directa de que Gemini 3.5 Flash es un modelo estable y generalmente disponible, con precios para cargas de trabajo de agentes empresariales en Google Cloud, no un marcador de posición o etiqueta de vista previa. Los lectores que comparen costos entre artículos deben verificar de qué página de precios se obtuvo una tarifa antes de tratar los números como intercambiables.

Comparación de modelos y costos para la API de Gemini 3.5 Flash

Todas las cifras a continuación son listados del directorio de TokenLab. Las filas marcadas como 'verificar con el proveedor' no tienen ninguna cita independiente suministrada para esta revisión.

Modelo Proveedor Ventana de contexto Entrada $/M tokens Salida $/M tokens Nota
gemini-3.5-flash Google 1,048,576 $1.50 $9.00 Directorio de TokenLab; verificar con la página de precios en vivo de Google
gemini-3.1-flash-lite Google n/a $0.25 $1.50 Directorio de TokenLab
gemini-3-pro-image Google n/a $2.00 $12.00 Directorio de TokenLab, nivel de imagen; no usar como sustituto de agente de texto
gpt-5 OpenAI n/a $1.25 $10.00 Directorio de TokenLab
gpt-5.5 OpenAI 1,050,000 $5.00 $30.00 Directorio de TokenLab - verificar con OpenAI
claude-sonnet-5 Anthropic 1,000,000 $2.00 $10.00 Directorio de TokenLab - verificar con Anthropic
claude-haiku-4-5 Anthropic n/a $1.00 $5.00 Directorio de TokenLab
deepseek-v4-flash DeepSeek 1,048,576 $0.09 $0.18 Directorio de TokenLab - verificar con DeepSeek

Para los bucles de agentes que realizan muchos turnos pequeños de llamadas a herramientas, la tarifa por token más barata no siempre es la tarifa por tarea más barata: un modelo que necesita menos reintentos o trazas de razonamiento más cortas puede superar un precio de lista más bajo. Mida el costo por tarea completada, no solo el costo por token.

Pasos de implementación para la API de Gemini 3.5 Flash

  1. Confirme el ID del modelo antes de escribir código. En el momento de la actualización, el ID del modelo a fijar era gemini-3.5-flash, y los documentos de modelos de Google lo listan como un ejemplo de modelo estable. Aun así, llame al endpoint de lista de modelos de su proveedor o consulte el directorio de TokenLab antes de la implementación. Esta es la solución para el problema de 'el SDK arrojó un error': la cadena no existía en el momento de la llamada. Ninguna cantidad de lógica de reintento soluciona un identificador incorrecto. Por ejemplo, la fuente describe ese modo de falla directamente.

  2. Enrute a través de un endpoint unificado en lugar de un SDK de proveedor sin procesar. Usar TokenLab (o una puerta de enlace similar) significa que el código de su aplicación hace referencia a un slug estable, y la puerta de enlace lo resuelve al identificador válido actual del proveedor. Esto desacopla su bucle de agente de los cambios de nombre o depreciaciones de modelos por parte del proveedor.

  3. Construya el bucle con pasos explícitos e instrumentación:

# Estructura ilustrativa solamente - confirme el endpoint/modelo exacto
# contra los documentos actuales de su puerta de enlace antes de implementar.
import time

def agent_loop(task):
    timings = {}

    t0 = time.time()
    plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
    timings["plan"] = time.time() - t0

    t0 = time.time()
    context = retrieve_context(plan)
    timings["retrieve"] = time.time() - t0

    t0 = time.time()
    tool_result = call_tool(plan, context)
    timings["tool_call"] = time.time() - t0

    t0 = time.time()
    synthesis = call_model(
        model="gemini-3.5-flash",
        prompt=build_synthesis_prompt(tool_result),
        max_output_tokens=512,
    )
    timings["synthesize"] = time.time() - t0

    t0 = time.time()
    response = format_response(synthesis)
    timings["respond"] = time.time() - t0

    return response, timings

En nuestra canalización, registramos los timings por ejecución y calculamos nuestro propio p50/p95 en un lote representativo de tareas. No publique ni confíe en un número fijo de 'N segundos por bucle' extraído del entorno de otra persona: las condiciones de la red, la longitud del prompt y la carga del proveedor alteran estos números.

  1. Limite los tokens de salida deliberadamente. Los tokens de salida cuestan aproximadamente 6 veces más que los tokens de entrada para gemini-3.5-flash según los precios del directorio anteriores. Probamos las matemáticas de precios. Establezca max_output_tokens por paso en lugar de dejar que el modelo se ejecute durante mucho tiempo. Esto es lo más importante en el paso de síntesis, donde las respuestas detalladas son comunes.

  2. Agregue una cadena de respaldo. Configure un modelo secundario (por ejemplo, gemini-3.1-flash-lite por costo, o un proveedor diferente por completo) para que una sola interrupción o depreciación del modelo no elimine a todo su agente.

Cuándo usar TokenLab

  • Desea un slug de modelo estable en lugar de una cadena de proveedor frágil. El enfoque de directorio de TokenLab significa que su código no necesita ser reescrito cada vez que un proveedor cambia el nombre o deprecia un modelo. El cierre del propio Veo 3.0 de Google está programado para el 30 de junio de 2026, lo que muestra el riesgo.
  • Necesita un lugar para comparar costos entre proveedores antes de comprometerse con un proveedor, en lugar de verificar manualmente cuatro páginas de precios separadas cada vez que evalúa un cambio de modelo.
  • Está ejecutando lógica de respaldo de múltiples proveedores y desea una forma de solicitud/respuesta consistente en los modelos de Google, Anthropic, OpenAI y DeepSeek en lugar de mantener cuatro integraciones de SDK separadas.

Lecturas relacionadas

Preguntas frecuentes

¿Es gemini-3.5-flash un ID de modelo válido que puedo llamar directamente contra el SDK de Google?

No lo asuma. Confírmelo contra la lista de modelos actual de Google antes de implementar: las cadenas de ID de modelo cambian y el estado de vista previa/GA cambia con el tiempo. Si está enrutando a través de TokenLab, la puerta de enlace maneja esta asignación por usted.

¿De dónde provienen los precios de la competencia en la tabla comparativa?

Son listados del directorio de TokenLab. Solo los precios de video de Veo en este artículo se remontan a una fuente de Google con fecha independiente (observada el 2026-07-08). Los precios de GPT-5.5, Claude Sonnet 5 y DeepSeek V4 Flash aquí no tienen ninguna cita independiente suministrada: verifique con cada proveedor antes de usar estos números en una estimación de costos orientada al cliente.

¿Qué tan rápido es un bucle de agente de Gemini 3.5 Flash de 5 pasos?

No se incluye ninguna cifra comparada aquí porque ninguna fue obtenida de forma independiente para este artículo. Instrumente su propio bucle (vea el ejemplo de código anterior) y mida la latencia p50/p95 real en su entorno en lugar de confiar en un número de segunda mano.

¿Qué sucede si el modelo que estoy usando se deprecia a mitad del proyecto?

Este es exactamente el escenario que ilustra el cierre de Veo 3.0 de Google (30 de junio de 2026). Construya una cadena de respaldo y, donde sea posible, enrute a través de una puerta de enlace que mantenga slugs de modelo actualizados para que una depreciación no requiera una reescritura de código.

Cree una clave de API de TokenLab para comparar los ID de modelo actuales antes de implementar.

Fuentes

Precio observado el 2026-07-08

Modelos relacionados

Modelos lanzados recientemente

Construye con los modelos de esta guía

Compara precios, prueba rutas y convierte la investigación en una llamada API real.