AI Development

Gemini 3.8 Flash: especificaciones, precio y quickstart

12 de septiembre de 2026
10 min de lectura
Guía de benchmarks y quickstart de Gemini 3.8 Flash
Compartir:

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026 — el tercer lanzamiento Flash en seis semanas y, según Google, su modelo Flash más inteligente hasta ahora para ingeniería de software de largo alcance, agentes autónomos y flujos empresariales complejos.

Mismo precio que 3.7 Flash, mismo contexto de 1M, razonamiento agéntico mediblemente mejor — pero más tokens por tarea. Acá va el panorama completo: ficha técnica, qué mejoró de verdad, código quickstart funcional y los límites honestos.

1. Ficha técnica: los hechos primero

Todo lo de abajo sale del anuncio oficial de Google, la model card de DeepMind y los docs de la API de Gemini — no de resúmenes de prensa. Model ID gemini-3.8-flash, disponible general desde el 2 de septiembre de 2026 y basado en Gemini 3.7 Flash según la model card.

🆔

Model ID

GA · 2 sep 2026

gemini-3.8-flash (estable, sin sufijo preview). Basado en Gemini 3.7 Flash. Tercer lanzamiento Flash en seis semanas, tras 3.6 (21 jul) y 3.7 (13 ago).

🧠

Ventana de contexto

1.048.576 in · 65.536 out

Un megatoken completo de entrada, 64K de salida máxima. Entrada: texto, imagen, video, audio, PDF (más URLs de YouTube). Salida: solo texto.

🎚️

Niveles de thinking

low · medium · high

Default en medium. El viejo nivel minimal ahora devuelve error 400 — mapealo a low. Los thinking tokens se facturan a precio de output.

📚

Corte de conocimiento

Marzo 2026

Info actualizada en algunos dominios, pero Google advierte que otros pueden reflejar conocimiento solo hasta enero de 2025.

🔒

Licencia

Propietaria · solo API

Sin pesos abiertos. Acceso vía Gemini API / AI Studio / Enterprise bajo los términos de Google. La variante Cyber está restringida al programa Fairwind.

🧩

Parámetros

No publicado

Google no publica el conteo de parámetros de 3.8 Flash, y no voy a inventar uno. Tratá cualquier número que veas por ahí como especulación.

💰 Precio oficial (público, según la página de precios de Google)

Introductorio hasta el 31 de diciembre de 2026: $0.75 por 1M de tokens de entrada, $3.75 por 1M de salida (thinking incluido). Desde el 1 de enero de 2027: $1.50 / $7.50. Batch y Flex salen la mitad; lecturas de caché $0.075 por 1M. Si estás presupuestando 2027 a $0.75, estás presupuestando con el número equivocado.

Idéntico a 3.7 Flash, fila por fila. El precio por token no se movió — pero el costo por tarea sí, porque 3.8 escribe ~30% más tokens de salida. Detalles en la sección 4.

2. Qué mejoró de verdad vs Gemini 3.7 Flash

El claim de Google es específico: en tareas difíciles 3.8 Flash da pasos de razonamiento más chicos, verifica su trabajo y llama herramientas en loop. Eso compra mejoras medibles en benchmarks agénticos — y cuesta más tokens por diseño. Acá van los números, con fuente para que sepas qué es vendor-reported y qué es independiente.

Artificial Analysis Intelligence Index

59 (high) · 3.7: 56 (high)

Independiente. Empata a GPT-5.6 Sol, un punto arriba de Claude Fable 5.1. Velocidad ~302–305 tok/s, la más rápida medida hasta entonces.

DeepSWE v1.1 (coding de largo alcance)

~73.7% · primer puesto · 3.7: 65.3%

Reportado por Google; casi iguala a Claude Opus 5 (74.0%) a una fracción del precio. El salto más grande del release.

Terminal-Bench 2.1

89.4–90.8% · 3.7: 81.6–85.8%

Reportado por Google. Réplicas independientes (Vals/BenchLM) dan ~81%: esperá que tu número caiga entre los dos.

Vals Finance Agent v2

61.4% · 3.7: 59.0%

Reportado por Google. Supera a Opus 5 (58.6%) y GPT-5.6 Sol (53.8%) — un modelo precio-Flash liderando agentes financieros.

Harvey Legal Agent Benchmark

10.0% · 3.7: 8.8%

Reportado por Google — pero leámoslo honestos: todos los modelos fallan este test. 3.8 es el que menos falla. Resultado real y chico.

HLE-Verified

54.9% · 3.7: 53.6%

Reportado por Google, triple empate con Sol (54.5%) y Opus 5 (54.4%). Mejora modesta, cerca de la frontera.

Cómo leer estos números

Código y tool-use saltaron (τ³-Banking: 45%, +12 sobre 3.7). Research en biología también lidera (LAB-Bench2 86.2%, arriba de Opus 5). Pero las mejoras son desparejas: en Terminal-Bench 4.0, la propia tabla de Google muestra 19.1% para 3.8 Flash contra 51.8% de Opus 5. Es un upgrade de workhorse para agentes y loops de código — no un reemplazo de modelos frontera.

3. Quickstart: JavaScript y Python

3.8 Flash es un swap directo de modelo: misma API, mismas herramientas (function calling, structured outputs, context caching, code execution, search grounding). Lo único que hay que setear a conciencia es el thinking level — ahora es una decisión de ruteo, no un default global.

JavaScript (@google/genai)

import { GoogleGenAI } from ’@google/genai’;

const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });

const res = await ai.models.generateContent({
  model: ’gemini-3.8-flash’,
  contents: ’Refactorizá esta función para legibilidad y agregá tests…’,
  config: { thinkingConfig: { thinkingLevel: ’medium’ } },
});

console.log(res.text);
// Revisá res.usageMetadata: los thought tokens facturan como output

Python (google-genai)

from google import genai
from google.genai import types

client = genai.Client()  # lee GEMINI_API_KEY

res = client.models.generate_content(
    model=’gemini-3.8-flash’,
    contents=’Refactorizá esta función para legibilidad y agregá tests…’,
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level=’medium’)
    ),
)

print(res.text)

Tres tips de costos que uso de verdad

  • Defaulteá a medium, no a high. Artificial Analysis midió $0.41 por tarea en medium vs $0.58 en high, con una caída de score de apenas 57 vs 59.
  • Las rutas sensibles a latencia van en low: $0.24 por tarea y ~0.8 min vs 2.5 min en high en el mismo harness.
  • Logueá thought tokens (usageMetadata) desde el día uno. El thinking factura como output, así que una respuesta corta en high puede salir más cara que una larga en low.

4. Límites honestos

Ningún review de modelo está completo sin las partes que el anuncio minimiza. Junté las que realmente te morderían en producción:

💸

El precio es una promo

Todas las tarifas se duplican el 1 de enero de 2027. Presupuestá multi-año a $1.50/$7.50, no al sticker de lanzamiento.

🔥

+30% tokens por tarea

Medición independiente: ~48.000 tokens de salida por tarea vs 3.7 Flash. Mismo precio por token, ~45% más caro por tarea difícil en high.

Primera palabra lenta

~305 tok/s una vez que arranca, pero ~13.3s de time-to-first-token en high. Ideal para agentes overnight, descalificante para widgets de chat.

🚫

Sin Live API ni salida multimedia

Salida solo texto: sin generación de imágenes, sin voz, sin sesiones realtime. Computer use sigue en preview.

⚠️

Dos gotchas de migración

thinking minimal ahora da error (mapealo a low), y cada function response debe llevar call id + name o los loops de tools fallan en el segundo turno.

📊

Brecha vendor vs independiente

Terminal-Bench 2.1 de Google (~90%) vs réplicas independientes (~81%). El veredicto de IntuitionLabs es por tarea: lidera en bio/finanzas/legal, pierde en extracción densa (GDP.PDF 35% vs 40% de Sol).

Regla de oro

No migres por benchmarks. Reproducí una muestra representativa de tus propios workloads en 3.8 Flash en medium contra tu modelo actual, y medí success rate, gasto total de tokens y tiempo de completitud. Si gana ahí, el leaderboard pasa a importar para tu negocio.

5. Bonus: agentic video understanding (−88% tokens)

Una semana antes de 3.8 Flash, Google lanzó agentic video understanding para la familia Flash (anunciado para 3.7/3.6/3.5-Lite el 1 de sep, con los docs listando también a 3.8 Flash). En vez de ingerir video a 1 FPS fijo, el modelo navega el timeline solo — decide qué mirar y si necesita frames, audio o transcript.

Google reporta hasta 88% menos tokens, hasta 66% menos costo y hasta 7% más accuracy en benchmarks de video largo. Son máximos vendor en contenido largo — un clip de dos minutos tiene poco para saltear — pero el mecanismo es sólido: pagás tarifa estándar solo por lo que el modelo carga de verdad.

Cómo activarlo

Seteá processing en ’agentic’ en tu request de video de la API de Gemini (acepta archivo subido o URL de YouTube). Sin recargo, sin endpoint separado — el ahorro llega solo vía menos tokens. El modo estático sigue siendo mejor para clips de menos de cinco minutos y trabajo de precisión frame por frame.

Veredicto: ¿conviene actualizar?

Gemini 3.8 Flash es un upgrade genuino y generalmente disponible — no un preview ni un rebrand. Para loops de código agénticos, research multi-paso y trabajo document-heavy donde la calidad le gana al conteo de tokens, es hoy el mejor valor del lineup de Google, sobre todo mientras dure el precio introductorio.

Pero no es automático. Si tu workload es clasificación de alto volumen, chat de contexto corto o cualquier cosa sensible a latencia, 3.7 Flash — o 3.8 en low — sigue siendo mejor compra, y Google lo dice explícitamente. Ruteá por workload, medí por tarea y presupuestá con precios 2027.

Matriz de upgrade: resumen

Actualizá a 3.8

  • • Agentes multi-paso con tool calls
  • • Harnesses de código de largo alcance
  • • Agentes de finanzas / legal / research

Quedate / usá low

  • • Llamadas cortas de alto volumen
  • • Endpoints sensibles a latencia
  • • Pipelines batch con costo al centavo
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego