Google lanzó Gemini 3.6 Flash el 21 de julio de 2026, disponible de inmediato en la Gemini API y en Google Cloud. Es un reemplazo directo de 3.5 Flash: mismo nivel de velocidad, más inteligencia, menos costo de salida. No hay razón para quedarse en la versión anterior.

Los números primero

El precio de salida bajó de $9.00 a $7.50 por millón de tokens. El precio de entrada se mantiene en $1.50 por millón. Para operaciones de alto volumen —respuestas largas, pipelines de procesamiento de documentos, agentes que generan texto extenso— eso es un ahorro directo sin cambiar nada en tu arquitectura.

-17% tokens de salida consumidos respecto a Gemini 3.5 Flash, según Artificial Analysis. Menos tokens y precio más bajo: doble ahorro en cada request.

El modelo también completa flujos de trabajo multi-paso en menos iteraciones: menos llamadas a herramientas, menos pasos de razonamiento intermedios. En pipelines agénticos donde cada llamada al modelo tiene costo, eso suma.

Mejor en código, verificable en benchmarks

Los números no vienen de Google. Son de benchmarks independientes y evaluaciones externas:

  • SWE-Bench Pro (resolución de issues reales de GitHub): 58.7% vs 55.1% de 3.5 Flash
  • DeepSWE (ingeniería de software avanzada): 49% vs 37%
  • MLE-Bench (investigación en machine learning): 63.9%
  • GDPval-AA (trabajo de conocimiento): 1,421 vs 1,349

La mejora en DeepSWE es la más relevante: 12 puntos porcentuales. Indica que el modelo resuelve tareas de ingeniería más complejas de forma autónoma, con menos ediciones no deseadas y menos iteraciones para llegar al resultado correcto. Para equipos que usan agentes de código, eso se traduce en menos revisiones manuales.

Computer Use ya es nativo en la API

Gemini 3.6 Flash incluye Computer Use como herramienta nativa en la Gemini API y en Gemini Enterprise. Esto significa que un agente puede controlar un navegador o escritorio —hacer clics, llenar formularios, navegar interfaces— sin librerías externas ni configuraciones especiales.

Para quienes construyen automatizaciones web, flujos de scraping con interacción, o agentes que operan sobre sistemas legacy sin API, esto elimina una capa completa de integración que antes requería soluciones ad-hoc.

1M tokens de contexto con 64k de salida máxima. La ventana completa disponible en todos los modelos de la familia Flash.

El paquete completo: tres modelos nuevos

Junto con 3.6 Flash, Google lanzó dos modelos adicionales:

Gemini 3.5 Flash-Lite — $0.30 entrada / $2.50 salida por millón de tokens. El modelo más barato de la familia. Diseñado para clasificaciones, resúmenes de alto volumen y cualquier tarea simple que necesite escala. Si tienes pipelines donde el costo por token es el factor limitante, este es el modelo a evaluar primero.

Gemini 3.5 Flash Cyber — acceso restringido. Especializado en seguridad ofensiva y defensiva. Disponible solo para organizaciones calificadas via programa de acceso anticipado.

Google también anticipó que Gemini 4 está en desarrollo, sin fecha de lanzamiento confirmada.

¿Cuándo migrar?

Si usas Gemini 3.5 Flash en producción: migra esta semana. El ID del modelo es gemini-3.6-flash. El cambio es drop-in para la mayoría de los casos: misma estructura de request, mismos parámetros. No hay razón para pagar más por el modelo anterior.

Si usas GPT-5.6 Sol o Claude Sonnet 5: vale la pena hacer pruebas en tareas multimodales y en pipelines de alto volumen de salida. En esos escenarios, 3.6 Flash puede reducir costos sin sacrificar calidad de manera medible.

Si estás evaluando Google AI por primera vez: el punto de entrada ahora es más capaz y más barato que antes. La combinación de 3.6 Flash para razonamiento y 3.5 Flash-Lite para volumen cubre la mayoría de los casos de uso empresariales con un costo competitivo.

El modelo tiene knowledge cutoff de marzo 2026. Para casos de uso que requieran información más reciente, considerar grounding con búsqueda web, disponible también en la API.


Fuentes: 9to5Google · Google Blog · Artificial Analysis · OfficeChai benchmarks · Google DeepMind