Gemini 3.8 Flash: Qué cambia, cuánto cuesta y cuándo conviene migrar
Google lanzó Gemini 3.8 Flash con mejoras en agentes, programación y razonamiento. Mantiene el precio de 3.7, pero puede consumir más tokens por tarea.
Gemini 3.8 Flash ya está disponible de forma general y llega apenas tres semanas después de Gemini 3.7 Flash. Google lo presenta como su modelo Flash más capaz para ingeniería de software de larga duración, agentes autónomos y flujos empresariales complejos. La actualización mejora especialmente la ejecución de tareas agentivas y de programación, pero introduce un matiz importante para quien evalúa costos: puede razonar más y, por tanto, consumir más tokens por tarea.
Eso cambia la pregunta práctica. No basta con mirar el precio por millón de tokens, porque Gemini 3.8 Flash mantiene el mismo precio introductorio que 3.7. Para decidir si conviene migrar hay que medir calidad final, cantidad total de tokens, latencia, llamadas a herramientas, errores y retrabajo humano. Google incluso recomienda mantener 3.7 Flash cuando la prioridad principal sea la eficiencia de cómputo.
En pocas palabras
- Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026 como modelo estable y de disponibilidad general.
- Admite hasta 1.048.576 tokens de entrada y 65.536 tokens de salida.
- Recibe texto, imágenes, video, audio y PDF; su salida documentada es texto.
- El precio API estándar introductorio es de US$0,75 por millón de tokens de entrada y US$3,75 por millón de tokens de salida hasta el 31 de diciembre de 2026.
- Desde el 1 de enero de 2027, las tarifas estándar publicadas pasan a US$1,50 de entrada y US$7,50 de salida por millón de tokens.
- El precio unitario es el mismo de Gemini 3.7 Flash, pero Google advierte que 3.8 puede utilizar más tokens para maximizar rendimiento.
- Los niveles de razonamiento disponibles son LOW, MEDIUM y HIGH; MEDIUM es el valor predeterminado en la guía empresarial de Google. MINIMAL no está soportado.
- Gemini 3.7 Flash sigue soportado y no tiene fecha de retiro anunciada.
Qué cambia realmente con Gemini 3.8 Flash
Gemini 3.8 Flash no amplía la ventana de contexto ni el máximo de salida frente a 3.7 Flash. Tampoco reduce el precio unitario. El cambio está principalmente en el comportamiento del modelo: Google reporta mayor precisión y confiabilidad en ingeniería de software, tareas agentivas y razonamiento especializado de varios pasos.
La propia guía de Google Cloud describe a la línea Flash como el “caballo de batalla” agentivo de la familia Gemini 3. En 3.8, ese enfoque se mueve hacia tareas de mayor duración y complejidad: agentes que usan herramientas, flujos de programación con varios pasos, análisis multimodal y procesos empresariales donde una respuesta aislada no es suficiente.
Para entender por qué esto importa, conviene revisar primero qué son los agentes de inteligencia artificial y cómo funcionan. Un modelo más capaz puede mejorar el agente, pero la confiabilidad final también depende de permisos, herramientas, datos, validaciones y reglas de ejecución.
Gemini 3.8 Flash frente a Gemini 3.7 Flash
| Aspecto | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Estado | Disponibilidad general | Disponibilidad general |
| Contexto máximo | 1.048.576 tokens | 1.048.576 tokens |
| Salida máxima | 65.536 tokens | 65.536 tokens |
| Thinking levels | LOW, MEDIUM, HIGH | LOW, MEDIUM, HIGH |
| Precio estándar introductorio | US$0,75 entrada / US$3,75 salida por MTok | US$0,75 entrada / US$3,75 salida por MTok |
| Enfoque principal | Agentes, programación y razonamiento complejo de varios pasos | Agentes generales, orquestación multietapa y programación |
| Consumo de tokens | Puede ser mayor para maximizar rendimiento | Google lo mantiene como opción cuando prima eficiencia de cómputo |
| Retiro anunciado | No | No |
Esta comparación evita una conclusión apresurada: migrar a 3.8 no es obligatorio. Si 3.7 ya cumple el criterio de calidad y el proceso está optimizado para costo o latencia, seguir utilizándolo puede ser una decisión válida. Si el cuello de botella está en razonamiento, ejecución de herramientas o programación de larga duración, 3.8 merece una evaluación con cargas reales.
Qué muestran los benchmarks publicados por Google
Google publica mejoras relevantes en varias pruebas frente a 3.7 Flash, pero no en todas. Es una señal útil porque evita presentar 3.8 como una mejora universal.
| Evaluación | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Terminal-bench 2.1 | 90,8% | 81,6% |
| SWE-Bench Pro | 61,6% | 60,4% |
| SWE-Atlas | 51,9% | 48,0% |
| τ³-bench Banking | 38,1% | 30,9% |
| CharXiv multimodal | 86,2% | 84,5% |
| GDP.pdf | 35,0% | 34,0% |
| Humanity’s Last Exam | 45,4% | 45,7% |
Los resultados sugieren ganancias más claras en terminal, agentes y determinados trabajos multimodales. Humanity’s Last Exam, en cambio, aparece ligeramente por debajo de 3.7 en la tabla de Google. Eso refuerza una práctica necesaria: los benchmarks sirven para orientar qué probar, no para predecir automáticamente el desempeño de un flujo empresarial concreto.
Precio de Gemini 3.8 Flash y el costo real por tarea
| Concepto | Hasta 31 de diciembre de 2026 | Desde 1 de enero de 2027 |
|---|---|---|
| Entrada | US$0,75 / 1M tokens | US$1,50 / 1M tokens |
| Salida, incluidos tokens de razonamiento | US$3,75 / 1M tokens | US$7,50 / 1M tokens |
| Lectura de contexto en caché | US$0,075 / 1M tokens | US$0,15 / 1M tokens |
El punto más fácil de perder es que precio por token y costo por tarea no son lo mismo. Google mantiene en 3.8 el mismo precio unitario introductorio de 3.7, pero también reconoce que el modelo puede utilizar más tokens para alcanzar mejor rendimiento, especialmente con niveles de esfuerzo altos.
Por eso una comparación de costos debería registrar, como mínimo:
- tokens de entrada;
- tokens de salida y razonamiento;
- contexto servido desde caché;
- número de llamadas a herramientas;
- tiempo total de ejecución;
- reintentos o fallos;
- minutos de revisión y corrección humana.
Un modelo que consume más tokens puede resultar más económico si reduce varias iteraciones o evita retrabajo. También puede ocurrir lo contrario: una tarea sencilla puede volverse más costosa sin obtener una mejora útil. La única forma de saberlo es medir el proceso completo.
LOW, MEDIUM y HIGH: cómo controlar razonamiento y consumo
Gemini 3.8 Flash permite ajustar el nivel de razonamiento mediante thinking_level. Google Cloud documenta tres valores válidos: LOW, MEDIUM y HIGH, con MEDIUM como predeterminado para 3.8 Flash en su plataforma empresarial. El nivel MINIMAL no está disponible y produce un error de validación.
| Nivel | Cuándo evaluarlo | Qué vigilar |
|---|---|---|
| LOW | Extracción, búsquedas rápidas, clasificación o tareas sensibles a latencia | Que la reducción de razonamiento no afecte exactitud o seguimiento de instrucciones |
| MEDIUM | Agentes y flujos generales que necesitan equilibrio entre calidad y consumo | Tokens totales, herramientas y consistencia entre ejecuciones |
| HIGH | Problemas complejos, razonamiento multietapa o análisis multimodal exigente | Mayor consumo, latencia y costo efectivo |
No conviene fijar HIGH como configuración universal. En un sistema de producción, el nivel de razonamiento puede convertirse en una política según tipo de tarea: menor esfuerzo para procesos previsibles y mayor esfuerzo únicamente donde la complejidad lo justifique.
Capacidades disponibles en la API
La ficha oficial de Google documenta un conjunto amplio de herramientas para Gemini 3.8 Flash:
- caching de contexto;
- ejecución de código;
- computer use en estado Preview;
- búsqueda de archivos;
- function calling;
- grounding con Google Search;
- grounding con Google Maps;
- salidas estructuradas;
- razonamiento configurable;
- contexto de URL.
También es importante registrar lo que no hace esta variante: la documentación indica que no soporta generación de imágenes, generación de audio ni Live API. Puede recibir imágenes, audio, video y PDF como entrada, pero la salida del modelo es texto.
Esto ayuda a diseñar la arquitectura correcta. Si un proceso necesita generar una imagen o mantener una experiencia de audio en tiempo real, esa función debe resolverse con otro modelo o componente; no debería asumirse solo porque Gemini 3.8 Flash sea multimodal en entrada.
Dónde está disponible Gemini 3.8 Flash
Google documenta Gemini 3.8 Flash como modelo estable y de disponibilidad general. Para desarrolladores aparece en Gemini API y Google AI Studio, y el anuncio también incluye Android Studio, Google Antigravity y Stitch entre las superficies de acceso. En el entorno empresarial, Google lo ofrece a través de Gemini Enterprise Agent Platform.
Para consumidores, Google anunció acceso para suscriptores de Google AI Pro y Ultra en superficies como la aplicación Gemini, AI Mode en Search y Gemini en Google Sheets. La disponibilidad exacta de una función puede variar por producto, cuenta o región, por lo que una empresa debería comprobar la superficie donde piensa implementarla antes de diseñar una dependencia permanente.
Qué revisar al migrar desde Gemini 3.7 o 3.6 Flash
Google publica una guía de migración específica. Aunque cambiar el identificador del modelo es sencillo, existen reglas de API que pueden romper clientes heredados.
- Cambia el model ID a
gemini-3.8-flash. - Sustituye
thinking_budgetporthinking_level. Los valores válidos son LOW, MEDIUM y HIGH. - Retira parámetros de muestreo obsoletos. Google indica que
temperature,top_kytop_pson ignorados por el backend en estas convenciones de Gemini 3. - Elimina parámetros no soportados.
frequency_penalty,presence_penaltyycandidate_countpueden producir errores activos. - Revisa el historial conversacional. Los turnos prefijados del modelo no están soportados y un historial no puede terminar con un turno de rol
model. - Valida function calling. Las respuestas de función deben coincidir estrictamente con el identificador, nombre y conteo de la llamada previa.
- Ejecuta pruebas de regresión. Comprueba calidad, latencia, consumo, formato estructurado y comportamiento de herramientas antes de mover tráfico importante.
Cuándo conviene probar 3.8 y cuándo puede ser mejor seguir con 3.7
| Situación | Decisión razonable | Motivo |
|---|---|---|
| Agentes complejos con varias herramientas | Probar 3.8 Flash | Google reporta mejoras en tareas agentivas y confiabilidad |
| Programación de larga duración o trabajo de terminal | Probar 3.8 Flash | Es una de las áreas con mejoras más claras en evaluaciones oficiales |
| Flujo estable y muy sensible a consumo | Comparar antes de migrar; considerar 3.7 | Google advierte mayor consumo de tokens en 3.8 y recomienda 3.7 cuando prima eficiencia de cómputo |
| Tareas simples y masivas | No asumir que 3.8 es necesario | La capacidad adicional puede no compensar el costo efectivo |
| Proceso con errores frecuentes de razonamiento en 3.7 | Evaluar 3.8 con casos reales | La mejora puede reducir iteraciones y retrabajo |
Casos de uso empresariales donde puede aportar valor
Agentes de desarrollo y mantenimiento de software
El posicionamiento oficial de 3.8 Flash prioriza software engineering y agentes de larga duración. Puede ser útil para analizar una base de código, investigar una incidencia, ejecutar herramientas autorizadas y proponer cambios. En producción, las modificaciones deben seguir pasando por pruebas, revisión de código y controles de despliegue.
Investigación documental y flujos de conocimiento
La combinación de contexto amplio, PDF, búsqueda, grounding y herramientas permite construir flujos que revisen documentos y fuentes antes de producir una síntesis. Esto puede reducir trabajo manual, pero no elimina la necesidad de validar hechos importantes ni sustituye fuentes maestras de la empresa.
Procesos multimodales
Gemini 3.8 Flash puede recibir texto, imágenes, audio y video. Eso permite evaluar procesos donde la información no llega en un único formato, por ejemplo revisar material audiovisual junto con documentación escrita. El beneficio debe medirse contra el costo de procesar archivos extensos y el nivel de razonamiento requerido.
Agentes operativos con herramientas
Function calling, búsqueda y computer use amplían lo que un agente puede hacer. A medida que aumenta la capacidad de actuar, también aumenta el impacto de un error. Para acciones que afecten clientes, dinero, permisos o información sensible, conviene aplicar mínimo acceso, registros de actividad y aprobación humana.
La guía de seguridad y privacidad al usar IA en un negocio reúne controles básicos que aplican independientemente del proveedor.
Limitaciones que Google documenta
El model card de Google DeepMind enumera límites que deberían formar parte de cualquier evaluación seria:
- Alucinaciones: puede producir información incorrecta como otros modelos fundacionales.
- Mayor consumo: en determinados casos utiliza más tokens para maximizar rendimiento, especialmente con niveles de esfuerzo altos.
- Latencia y timeouts: Google reconoce que pueden presentarse episodios de lentitud o tiempo de espera.
- Conocimiento no completamente actual: el cutoff indicado es marzo de 2026, aunque Google advierte que algunos dominios pueden comportarse como si estuvieran limitados a enero de 2025.
- Computer use sigue en Preview: no debe tratarse como una capacidad estable equivalente al núcleo GA del modelo.
- No genera imágenes ni audio: su multimodalidad está principalmente en la entrada.
Además, el model card señala que, en evaluaciones automatizadas, el desempeño de seguridad en idiomas distintos del inglés mostró una ligera regresión frente a 3.7, aunque la revisión manual de Google no encontró preocupaciones graves. Para un negocio que opere principalmente en español, esto es una razón adicional para probar instrucciones, rechazos y casos ambiguos en el idioma real de uso.
Más capacidad agentiva exige mejores controles
Google afirma haber reforzado mitigaciones relacionadas con seguridad y robustez frente a inyección de instrucciones. Eso no convierte a un agente en un sistema infalible. Si el modelo puede navegar, leer documentos o usar herramientas, una instrucción maliciosa incluida en una fuente externa puede intentar desviar el flujo.
Una implementación empresarial debería conservar al menos estos controles:
- permisos mínimos por herramienta;
- separación entre lectura y escritura;
- aprobación humana para acciones difíciles de revertir;
- registro de llamadas a herramientas y resultados;
- límites de costo y número de pasos;
- validación de datos importantes contra la fuente original;
- pruebas adversas antes de ampliar autonomía.
Cómo evaluar Gemini 3.8 Flash con datos reales
- Escoge entre 20 y 50 tareas representativas. Incluye casos fáciles, difíciles, ambiguos y fallos conocidos de 3.7.
- Define una respuesta correcta o un criterio de aceptación. Sin una referencia no podrás medir mejora.
- Ejecuta 3.7 y 3.8 con condiciones comparables. Registra el nivel de razonamiento utilizado.
- Mide costo efectivo por tarea. No te limites a la tarifa por MTok.
- Registra errores de herramientas y formato. Un agente puede fallar aunque la respuesta textual parezca buena.
- Cuenta las correcciones humanas. Menos retrabajo puede compensar un mayor consumo de tokens.
- Evalúa latencia. Un modelo mejor no necesariamente es mejor para una interacción que necesita respuesta inmediata.
- Mantén un grupo de control. No migres todo el tráfico antes de comprobar que la mejora se sostiene.
Métricas que sí ayudan a decidir
| Métrica | Qué responde |
|---|---|
| Tasa de tareas completadas | ¿Resuelve el objetivo sin intervención adicional? |
| Tokens por tarea | ¿Cuánto razonamiento y generación consume realmente? |
| Costo por tarea exitosa | ¿Cuánto cuesta obtener un resultado usable, no solo una llamada? |
| Latencia total | ¿El tiempo de respuesta es adecuado para el proceso? |
| Errores de tool use | ¿Usa herramientas de forma consistente? |
| Retrabajo humano | ¿Cuánto tiempo sigue necesitando una persona para corregir? |
| Incidentes críticos | ¿Comete errores que impiden automatizar el flujo con seguridad? |
Preguntas frecuentes
¿Gemini 3.8 Flash está en preview?
No. Google lo documenta como modelo estable y de disponibilidad general desde el 2 de septiembre de 2026. Algunas capacidades asociadas, como computer use, sí permanecen en Preview.
¿Gemini 3.8 Flash es más caro que 3.7 Flash?
El precio estándar por millón de tokens es el mismo durante el periodo introductorio y Google publica la misma tarifa futura para ambos. Sin embargo, 3.8 puede usar más tokens por tarea, por lo que el costo efectivo sí puede ser mayor. También puede ser menor si la mejor calidad reduce reintentos y correcciones.
¿Hay que migrar de 3.7 a 3.8 Flash?
No. Google no ha anunciado una fecha de apagado para 3.7 Flash y explícitamente lo señala como opción cuando se busca mayor eficiencia de cómputo. La migración debería justificarse con resultados propios.
¿Gemini 3.8 Flash genera imágenes?
No. Puede recibir imágenes como entrada, pero la ficha oficial marca la generación de imágenes como no soportada. Lo mismo ocurre con la generación de audio y Live API.
¿Cuánto contexto admite Gemini 3.8 Flash?
La ficha oficial documenta 1.048.576 tokens de entrada y hasta 65.536 tokens de salida.
La actualización merece pruebas, no una migración automática
Gemini 3.8 Flash es una actualización relevante para agentes, programación y tareas complejas de varios pasos. Mantiene las dimensiones principales de 3.7 —contexto, salida y precio unitario— mientras intenta mejorar la calidad del trabajo agentivo. El costo de esa mejora puede aparecer en forma de más tokens y, en algunos casos, mayor latencia.
Para una empresa, la decisión más sólida es comparar 3.8 y 3.7 con tareas reales. Si 3.8 completa más procesos correctamente y reduce retrabajo, el mayor consumo puede estar justificado. Si la tarea ya funciona bien y el objetivo es minimizar cómputo, 3.7 sigue siendo una alternativa válida y oficialmente soportada.
Tambien podría interesarte sobre Inteligencia Artificial
Seguridad y Privacidad: Cómo Usar Herramientas de IA en tu Negocio sin Filtrar Datos Sensibles
Claude Sonnet 5: qué cambia en agentes, rendimiento y costo
Cómo Usar la Inteligencia Artificial para Redactar Contenidos y Fichas de Producto de tu Negocio
Microsoft 365 Business con Copilot: qué cambia para las pymes
Agentes de inteligencia artificial: qué son y cómo funcionan
IA para pequeños negocios: por qué 2026 marca un cambio práctico
Claude Mythos 5.1: Qué es, quién puede usarlo y en qué se diferencia de Fable
Recursos y Apoyos
Ofrecemos diversos recursos para que te familiarices y entiendas sobre tus recursos, posibilidades y goces de los beneficios de tener una infraestructura digital. Además, tenemos programas sociales para acompañar emprendimientos y proyectos con beneficios exclusivos
