Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026 — el tercer lanzamiento Flash en seis semanas y, según Google, su modelo Flash más inteligente hasta ahora para ingeniería de software de largo alcance, agentes autónomos y flujos empresariales complejos.
Mismo precio que 3.7 Flash, mismo contexto de 1M, razonamiento agéntico mediblemente mejor — pero más tokens por tarea. Acá va el panorama completo: ficha técnica, qué mejoró de verdad, código quickstart funcional y los límites honestos.
1. Ficha técnica: los hechos primero
Todo lo de abajo sale del anuncio oficial de Google, la model card de DeepMind y los docs de la API de Gemini — no de resúmenes de prensa. Model ID gemini-3.8-flash, disponible general desde el 2 de septiembre de 2026 y basado en Gemini 3.7 Flash según la model card.
Model ID
GA · 2 sep 2026
gemini-3.8-flash (estable, sin sufijo preview). Basado en Gemini 3.7 Flash. Tercer lanzamiento Flash en seis semanas, tras 3.6 (21 jul) y 3.7 (13 ago).
Ventana de contexto
1.048.576 in · 65.536 out
Un megatoken completo de entrada, 64K de salida máxima. Entrada: texto, imagen, video, audio, PDF (más URLs de YouTube). Salida: solo texto.
Niveles de thinking
low · medium · high
Default en medium. El viejo nivel minimal ahora devuelve error 400 — mapealo a low. Los thinking tokens se facturan a precio de output.
Corte de conocimiento
Marzo 2026
Info actualizada en algunos dominios, pero Google advierte que otros pueden reflejar conocimiento solo hasta enero de 2025.
Licencia
Propietaria · solo API
Sin pesos abiertos. Acceso vía Gemini API / AI Studio / Enterprise bajo los términos de Google. La variante Cyber está restringida al programa Fairwind.
Parámetros
No publicado
Google no publica el conteo de parámetros de 3.8 Flash, y no voy a inventar uno. Tratá cualquier número que veas por ahí como especulación.
💰 Precio oficial (público, según la página de precios de Google)
Introductorio hasta el 31 de diciembre de 2026: $0.75 por 1M de tokens de entrada, $3.75 por 1M de salida (thinking incluido). Desde el 1 de enero de 2027: $1.50 / $7.50. Batch y Flex salen la mitad; lecturas de caché $0.075 por 1M. Si estás presupuestando 2027 a $0.75, estás presupuestando con el número equivocado.
Idéntico a 3.7 Flash, fila por fila. El precio por token no se movió — pero el costo por tarea sí, porque 3.8 escribe ~30% más tokens de salida. Detalles en la sección 4.
2. Qué mejoró de verdad vs Gemini 3.7 Flash
El claim de Google es específico: en tareas difíciles 3.8 Flash da pasos de razonamiento más chicos, verifica su trabajo y llama herramientas en loop. Eso compra mejoras medibles en benchmarks agénticos — y cuesta más tokens por diseño. Acá van los números, con fuente para que sepas qué es vendor-reported y qué es independiente.
Artificial Analysis Intelligence Index
59 (high) · 3.7: 56 (high)
Independiente. Empata a GPT-5.6 Sol, un punto arriba de Claude Fable 5.1. Velocidad ~302–305 tok/s, la más rápida medida hasta entonces.
DeepSWE v1.1 (coding de largo alcance)
~73.7% · primer puesto · 3.7: 65.3%
Reportado por Google; casi iguala a Claude Opus 5 (74.0%) a una fracción del precio. El salto más grande del release.
Terminal-Bench 2.1
89.4–90.8% · 3.7: 81.6–85.8%
Reportado por Google. Réplicas independientes (Vals/BenchLM) dan ~81%: esperá que tu número caiga entre los dos.
Vals Finance Agent v2
61.4% · 3.7: 59.0%
Reportado por Google. Supera a Opus 5 (58.6%) y GPT-5.6 Sol (53.8%) — un modelo precio-Flash liderando agentes financieros.
Harvey Legal Agent Benchmark
10.0% · 3.7: 8.8%
Reportado por Google — pero leámoslo honestos: todos los modelos fallan este test. 3.8 es el que menos falla. Resultado real y chico.
HLE-Verified
54.9% · 3.7: 53.6%
Reportado por Google, triple empate con Sol (54.5%) y Opus 5 (54.4%). Mejora modesta, cerca de la frontera.
Cómo leer estos números
Código y tool-use saltaron (τ³-Banking: 45%, +12 sobre 3.7). Research en biología también lidera (LAB-Bench2 86.2%, arriba de Opus 5). Pero las mejoras son desparejas: en Terminal-Bench 4.0, la propia tabla de Google muestra 19.1% para 3.8 Flash contra 51.8% de Opus 5. Es un upgrade de workhorse para agentes y loops de código — no un reemplazo de modelos frontera.
3. Quickstart: JavaScript y Python
3.8 Flash es un swap directo de modelo: misma API, mismas herramientas (function calling, structured outputs, context caching, code execution, search grounding). Lo único que hay que setear a conciencia es el thinking level — ahora es una decisión de ruteo, no un default global.
JavaScript (@google/genai)
import { GoogleGenAI } from ’@google/genai’;
const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
const res = await ai.models.generateContent({
model: ’gemini-3.8-flash’,
contents: ’Refactorizá esta función para legibilidad y agregá tests…’,
config: { thinkingConfig: { thinkingLevel: ’medium’ } },
});
console.log(res.text);
// Revisá res.usageMetadata: los thought tokens facturan como outputPython (google-genai)
from google import genai
from google.genai import types
client = genai.Client() # lee GEMINI_API_KEY
res = client.models.generate_content(
model=’gemini-3.8-flash’,
contents=’Refactorizá esta función para legibilidad y agregá tests…’,
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level=’medium’)
),
)
print(res.text)Tres tips de costos que uso de verdad
- • Defaulteá a medium, no a high. Artificial Analysis midió $0.41 por tarea en medium vs $0.58 en high, con una caída de score de apenas 57 vs 59.
- • Las rutas sensibles a latencia van en low: $0.24 por tarea y ~0.8 min vs 2.5 min en high en el mismo harness.
- • Logueá thought tokens (usageMetadata) desde el día uno. El thinking factura como output, así que una respuesta corta en high puede salir más cara que una larga en low.
4. Límites honestos
Ningún review de modelo está completo sin las partes que el anuncio minimiza. Junté las que realmente te morderían en producción:
El precio es una promo
Todas las tarifas se duplican el 1 de enero de 2027. Presupuestá multi-año a $1.50/$7.50, no al sticker de lanzamiento.
+30% tokens por tarea
Medición independiente: ~48.000 tokens de salida por tarea vs 3.7 Flash. Mismo precio por token, ~45% más caro por tarea difícil en high.
Primera palabra lenta
~305 tok/s una vez que arranca, pero ~13.3s de time-to-first-token en high. Ideal para agentes overnight, descalificante para widgets de chat.
Sin Live API ni salida multimedia
Salida solo texto: sin generación de imágenes, sin voz, sin sesiones realtime. Computer use sigue en preview.
Dos gotchas de migración
thinking minimal ahora da error (mapealo a low), y cada function response debe llevar call id + name o los loops de tools fallan en el segundo turno.
Brecha vendor vs independiente
Terminal-Bench 2.1 de Google (~90%) vs réplicas independientes (~81%). El veredicto de IntuitionLabs es por tarea: lidera en bio/finanzas/legal, pierde en extracción densa (GDP.PDF 35% vs 40% de Sol).
Regla de oro
No migres por benchmarks. Reproducí una muestra representativa de tus propios workloads en 3.8 Flash en medium contra tu modelo actual, y medí success rate, gasto total de tokens y tiempo de completitud. Si gana ahí, el leaderboard pasa a importar para tu negocio.
5. Bonus: agentic video understanding (−88% tokens)
Una semana antes de 3.8 Flash, Google lanzó agentic video understanding para la familia Flash (anunciado para 3.7/3.6/3.5-Lite el 1 de sep, con los docs listando también a 3.8 Flash). En vez de ingerir video a 1 FPS fijo, el modelo navega el timeline solo — decide qué mirar y si necesita frames, audio o transcript.
Google reporta hasta 88% menos tokens, hasta 66% menos costo y hasta 7% más accuracy en benchmarks de video largo. Son máximos vendor en contenido largo — un clip de dos minutos tiene poco para saltear — pero el mecanismo es sólido: pagás tarifa estándar solo por lo que el modelo carga de verdad.
Cómo activarlo
Seteá processing en ’agentic’ en tu request de video de la API de Gemini (acepta archivo subido o URL de YouTube). Sin recargo, sin endpoint separado — el ahorro llega solo vía menos tokens. El modo estático sigue siendo mejor para clips de menos de cinco minutos y trabajo de precisión frame por frame.
Veredicto: ¿conviene actualizar?
Gemini 3.8 Flash es un upgrade genuino y generalmente disponible — no un preview ni un rebrand. Para loops de código agénticos, research multi-paso y trabajo document-heavy donde la calidad le gana al conteo de tokens, es hoy el mejor valor del lineup de Google, sobre todo mientras dure el precio introductorio.
Pero no es automático. Si tu workload es clasificación de alto volumen, chat de contexto corto o cualquier cosa sensible a latencia, 3.7 Flash — o 3.8 en low — sigue siendo mejor compra, y Google lo dice explícitamente. Ruteá por workload, medí por tarea y presupuestá con precios 2027.
Matriz de upgrade: resumen
Actualizá a 3.8
- • Agentes multi-paso con tool calls
- • Harnesses de código de largo alcance
- • Agentes de finanzas / legal / research
Quedate / usá low
- • Llamadas cortas de alto volumen
- • Endpoints sensibles a latencia
- • Pipelines batch con costo al centavo
Fuentes
- Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (2 sep 2026)
- DeepMind — Gemini 3.8 Flash model card
- Google — Novedades de Gemini 3.8 Flash (docs API)
- IntuitionLabs — Accuracy, Latency, and Cost for Research Tasks (sep 2026)
- MarkTechPost — Agentic Video Understanding recorta tokens hasta 88% (sep 2026)
- Google — Introducing agentic video understanding (1 sep 2026)



