

Los tres nuevos modelos de Google DeepMind para agentes de IA
Gemini 3.6 Flash, 3.5 Flash-Lite y Gemma 4 de Google DeepMind forman un stack de tres niveles para agentes de IA. Compara latencia, costo, uso de herramientas y control del despliegue.
Si tuviera que reducirlo a una línea, sería esta: usa Gemini 3.5 Flash-Lite para el enrutamiento barato de primera pasada, Gemini 3.6 Flash para el trabajo principal de los agentes y Gemma 4 cuando necesites ejecutar en tus propios sistemas.
Aquí va la versión corta. El artículo compara tres modelos en los puntos que más importan para los agentes de IA: latencia, costo, uso de herramientas, entrada multimodal, planificación y control del despliegue. Un modelo está construido para el triaje de alto volumen, otro encaja en la ejecución del día a día y otro está hecho para cargas autoalojadas y privadas.
Lo que más me llamó la atención:
- Gemini 3.5 Flash-Lite es el divisor de tráfico de bajo costo para clasificación, extracción y enrutamiento, con latencia por debajo de 200 ms
- Gemini 3.6 Flash se sitúa en el medio como el caballo de batalla principal para llamadas a herramientas, trabajo con documentos y pasos de flujo, con una latencia de alrededor de ~500 ms
- Gemma 4 mueve la balanza hacia pesos abiertos, licencia Apache 2.0, despliegue local y manejo privado de datos
- Gemma 4 va de 2.3B a 31B parámetros, con hasta 256K de contexto
- La versión 26B A4B MoE activa 3.8B de 25.2B parámetros en inferencia
- Una configuración por niveles puede reducir el gasto manteniendo las tareas simples en modelos más pequeños y enviando los casos difíciles a los más grandes
Si tienes que elegir rápido:
elige Flash-Lite para enrutamiento, Flash para ejecución y Gemma 4 para control autoalojado.

El 3.6 Flash de Google demuestra que los agentes de IA están a punto de abaratarse
Comparación rápida
| Modelo | Mejor uso | Latencia | Despliegue | Principal contrapartida |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | Clasificación, extracción, enrutamiento | <200 ms | Google AI Studio / Vertex AI | Menor profundidad de razonamiento |
| Gemini 3.6 Flash | Ejecución central de agentes, uso de herramientas, tareas de contexto largo | ~500 ms | Google AI Studio / Vertex AI | Más costo que Lite |
| Gemma 4 | Trabajo de agentes privado, regulado u offline | Depende del hardware | Autoalojado / nube privada | Más trabajo de infraestructura |
En otras palabras, no se trata de elegir un único modelo "mejor". Se trata de emparejar cada modelo con el trabajo usando una API de LLM unificada para que tu stack de agentes se mantenga rápido, consciente del costo y bajo tu control donde haga falta.
1. Gemini 3.6 Flash

Encaje en cargas de trabajo de agentes
De los tres modelos, Gemini 3.6 Flash es la opción orientada al rendimiento. Úsalo para agentes de alto volumen que necesitan baja latencia, costo estable y respuestas rápidas.
Latencia y rendimiento
Eso lo convierte en un buen encaje para flujos con muchas solicitudes, como el triaje de tickets, la consulta de documentos o el enrutamiento de tareas a gran escala. En estos casos, la velocidad importa sobre todo cuando el modelo también necesita actuar de forma estable y confiable.
Uso de herramientas y personalización
Puedes combinarlo con function calling, recuperación, comprobaciones de políticas y pasos de aprobación humana para mantener la automatización controlada. Por ejemplo, funciona bien para un agente que lee una solicitud, extrae documentos fuente, llama a herramientas y envía los casos límite a un humano.
A continuación, Gemini 3.5 Flash-Lite mueve la balanza hacia tareas de agentes más ligeras y de menor costo.
2. Gemini 3.5 Flash-Lite

Encaje en cargas de trabajo de agentes
Gemini 3.5 Flash-Lite es el modelo de bajo costo por defecto para clasificación, extracción y enrutamiento de alto volumen. Piensa en él como la capa de control ligera de un stack de agentes: maneja el grueso del tráfico mientras los modelos más grandes intervienen en las decisiones más difíciles.
Latencia y rendimiento
Su latencia por debajo de 200 ms lo hace un fuerte candidato para flujos de fan-out, procesamiento por lotes y enrutamiento rápido. Cuando un sistema de agentes divide un trabajo grande en muchas tareas pequeñas, Flash-Lite puede despachar esas subtareas rápido y luego devolver los resultados para su consolidación.
Costo y modelo de despliegue
Su bajo costo lo convierte en el modelo por defecto de primera pasada para grandes colas de tareas simples. Si el control del despliegue y los pesos abiertos importan más que esta configuración, Gemma 4 cambia esa balanza.
Uso de herramientas y personalización
Flash-Lite admite salidas estructuradas y ajuste ligero de tareas para enrutamiento y extracción. Un patrón común es simple: usa Flash-Lite como clasificador o extractor de primera pasada y luego envía solo los casos límite a un modelo más fuerte. Así, los agentes más grandes pueden reservar los modelos pesados para la planificación, el razonamiento multimodal y las excepciones difíciles.
3. Gemma 4

Encaje en cargas de trabajo de agentes
Gemma 4 es la elección orientada al control para stacks de agentes que necesitan ejecutarse localmente, trabajar con datos sensibles y mantenerse fáciles de ajustar. Su licencia Apache 2.0 permite a los equipos hacer fine-tuning y desplegarlo en sistemas locales, lo que encaja en entornos regulados u offline con reglas estrictas de gobernanza de datos. También puede redactar la PII en el punto de entrada antes de que los datos salgan de los sistemas locales, algo muy útil para equipos de salud y finanzas [1].
Eso importa porque el control local no es solo cuestión de privacidad. También es decidir cuánto puedes ajustar el modelo, dónde se ejecuta y qué tipo de carga puede manejar. Con Gemma 4, eso se reduce al tamaño del modelo, la ventana de contexto y el costo de ejecución.
Latencia y rendimiento
Gemma 4 va desde un modelo móvil de 2.3B hasta un modelo de servidor de 31B. Eso da a los equipos margen para emparejar el modelo con el trabajo en lugar de forzar a un solo modelo a hacerlo todo. Los modelos pequeños pueden manejar tareas de borde, mientras que los grandes pueden asumir la planificación o el razonamiento de contexto largo.
La variante 26B A4B MoE destaca aquí. En inferencia, activa 3.8B de 25.2B parámetros, lo que ayuda a mantener la ejecución más eficiente. En longitud de contexto, los modelos más pequeños admiten 128K tokens, mientras que los modelos de 12B, 26B A4B y 31B admiten 256K tokens. Eso encaja bien con documentos largos y trazas de agentes largas [1].
Costo y modelo de despliegue
Ejecutar Gemma 4 en tu propio hardware elimina las tarifas de API por token, pero la factura no desaparece. Se traslada a servidores, escalado y disponibilidad. Así que, en lugar de pagarle a un proveedor, pagas por el stack que hay detrás del modelo.
Gemma 4 también ofrece a los equipos varias formas de recortar el uso de memoria. Hay checkpoints de Quantization-Aware Training (QAT) disponibles en formatos GGUF, wNa8o8 optimizado para móviles y Compressed Tensors w4a16. Estos pueden reducir las necesidades de memoria manteniendo la calidad de salida cercana a bfloat16 [1].
Esa configuración hace del modelo un fuerte candidato cuando los agentes necesitan control local y ejecución estructurada, y cuando el equipo está listo para gestionar la infraestructura que eso conlleva.
Uso de herramientas y personalización
Gemma 4 admite function calling nativo y un rol de sistema nativo, lo que da a los desarrolladores de agentes un control más directo sobre el flujo de la conversación y la ejecución de tareas [1]. También funciona con transformers, vLLM y llama.cpp [1], así que puede encajar en stacks que muchos equipos ya usan.
La variante Unified de 12B puede recibir entradas de imagen y audio directamente. Eso es útil para agentes multimodales que necesitan una única ruta de fine-tuning para entradas de texto, imagen y audio [1].
Gemma 4 también incluye un modo "Thinking" integrado. Ayuda en tareas más difíciles, pero añade latencia. En términos simples: úsalo para planificación y razonamiento complejo, no para enrutamiento rápido [1]. Así que, aunque Gemma 4 apuesta fuerte por el control, ese control viene con exigencias de infraestructura y algunas contrapartidas de velocidad.
Contrapartidas, opciones de integración y pros y contras
Si miras estos modelos como un stack, se dividen con bastante claridad en tres trabajos: triaje, ejecución y control local.
Así que la decisión principal no es solo qué modelo es mejor. Es si quieres que un solo modelo lo maneje todo, o una configuración por niveles donde cada modelo asume la parte que mejor hace.
Una arquitectura por niveles tiende a encajar mejor en agentes complejos a escala empresarial. Flash-Lite puede asumir el triaje y el enrutamiento de alto volumen con la menor latencia y costo. Gemini 3.6 Flash puede encargarse de la ejecución central de flujos, el uso de herramientas y el trabajo de contexto largo. Gemma 4 encaja en cargas reguladas o privadas que necesitan autoalojamiento o despliegue en nube privada.
Usadas así, los equipos pueden recortar costos de forma significativa comparado con enviar cada solicitud a un único modelo de mayor capacidad. En ese punto, la contrapartida cambia: control del despliegue vs. simplicidad operativa.
Para generación de imagen o video fuera del razonamiento de texto, APIMart puede enrutar tareas a través de una única API multimodal.
La tabla siguiente resume las principales rutas de integración.
| Modelo / Configuración | Ruta de integración | Latencia | Perfil de costo | Contrapartida clave |
|---|---|---|---|---|
| APIMart (gateway unificado) | Una API → 500+ modelos | Depende del orquestador | Basado en uso | Añade dependencia de una capa gestionada |
| Gemini 3.5 Flash-Lite | Google AI Studio / Vertex AI | <200 ms | El más bajo | Razonamiento profundo limitado |
| Gemini 3.6 Flash | Google AI Studio / Vertex AI | ~500 ms | Moderado | Costo mayor que Lite |
| Gemma 4 (autoalojado) | vLLM / llama.cpp / nube privada | Depende del hardware | Alto (costo de infraestructura) | Fuerte carga de mantenimiento; propiedad total de los datos |
| Configuración por niveles | Orquestador (p. ej., LangChain) | Mixta / optimizada | Optimizado | Más difícil de depurar y trazar; control híbrido |
En la práctica, estas contrapartidas dibujan una elección bastante simple: usar un modelo de principio a fin, o repartir el enrutamiento, la ejecución y las cargas privadas entre capas diferentes.
Conclusión
El modelo adecuado se reduce a tres cosas: complejidad de la tarea, presupuesto y control del despliegue.
Con esa lente, Gemini 3.5 Flash-Lite es la primera elección para el enrutamiento ligero. Encaja bien en trabajo de enrutamiento y extracción de alto volumen. Úsalo para clasificación, extracción y enrutamiento de primera pasada. Si el trabajo necesita más coordinación, sube a Gemini 3.6 Flash.
Gemini 3.6 Flash funciona como la capa de ejecución por defecto para agentes en producción. Se sitúa entre el menor costo de Flash-Lite y el despliegue orientado al control de Gemma 4, lo que lo convierte en una opción sólida por defecto para equipos que quieren buena salida a escala. Si el control del despliegue es lo que más importa, Gemma 4 se convierte en el mejor encaje.
Gemma 4 está construido para equipos que necesitan control, privacidad o acceso offline. Encaja en entornos regulados porque admite procesamiento en el dispositivo o autoalojado y redacción local de PII. Sus pesos abiertos también simplifican el fine-tuning por dominio.
Usa Flash-Lite para enrutamiento, Gemini 3.6 Flash para ejecución y Gemma 4 para control autoalojado.
Preguntas frecuentes
¿Cuándo debería usar una configuración de modelos por niveles?
Usa una configuración de modelos por niveles cuando necesites equilibrar rendimiento, costo y fiabilidad a medida que crece tu app.
La idea básica es esta: envía las tareas simples y de alto volumen a modelos de menor costo, y reserva los modelos de frontera para el trabajo complejo y de alto riesgo.
Ese reparto puede recortar los costos de API entre un 60% y un 80%, especialmente cuando solo escalas una solicitud después de que un modelo más ligero no alcance tu umbral de confianza.
Es una contrapartida bastante simple. No necesitas que tu modelo más avanzado maneje cada tarea rutinaria. Deja que el modelo más ligero dé la primera pasada y trae al modelo pesado solo cuando el trabajo lo exija.
¿Cómo elijo entre Gemini 3.6 Flash y Gemma 4?
Elige según lo que más te importe: velocidad, escala o control.
Gemini 3.6 Flash es un modelo multimodal de alto rendimiento construido para tareas de baja latencia y alto volumen. Eso lo hace un fuerte candidato para apps en tiempo real y flujos sensibles al costo.
Gemma 4 tiene más sentido si quieres más control y flexibilidad, como el despliegue local o ejecutar el modelo en tu propia infraestructura. Opta por Gemini 3.6 Flash para producción rápida y escalable. Elige Gemma 4 para uso privado en el dispositivo o fine-tuning personalizado.
¿Qué tareas de agentes encajan mejor con Flash-Lite?
Flash-Lite es un buen encaje para trabajo de alto volumen y sensible al costo donde la eficiencia importa más que el razonamiento profundo. Rinde especialmente bien en extracción de datos básica y clasificación.
También funciona bien como primera capa de una cascada de modelos. En muchas configuraciones, puede resolver entre el 70% y el 85% de las solicitudes antes de enviar las consultas más difíciles a modelos premium. Eso puede recortar los costos entre un 60% y un 75% manteniendo estables los flujos de agentes estándar.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.
