La mayoría de los modelos abiertos asumen que tenés un servidor. La familia Gemma 3 de Google apuesta lo contrario: IA capaz que corre en tu teléfono, tu laptop o una Raspberry Pi de 60 dólares. Las variantes 3n van más lejos, metiendo texto, visión y audio en 2GB de memoria.
En esta guía desarmo la ficha real, qué mejoró de verdad vs Gemma 2, benchmarks verificados y un quickstart de 5 minutos con Ollama y transformers para correrlo en local hoy mismo.
1. La Ficha: Gemma 3 y 3n de un Vistazo
Gemma 3 salió el 12 de marzo de 2025 en cinco tamaños, y Gemma 3n llegó con release completo el 26 de junio de 2025 como la rama mobile-first de la familia. Ambos son modelos de pesos abiertos construidos con el mismo research detrás de Gemini. Esta es la ficha que importa para builders:
Parámetros
Gemma 3 · Gemma 3n
Gemma 3: 270M, 1B, 4B, 12B, 27B. Gemma 3n: E2B (5B reales, ~2B efectivos) y E4B (8B reales, ~4B efectivos) gracias a anidado MatFormer y cacheo Per-Layer Embedding.
Contexto
32K · 128K
128K tokens para Gemma 3 4B/12B/27B, 32K para 1B/270M y ambas variantes 3n. Suficiente para documentos largos y conversaciones multi-imagen en el dispositivo.
Modalidades
Texto · Imagen · Audio · Video
Gemma 3 maneja texto + imágenes. Gemma 3n suma audio (transcripción y traducción de voz) y comprensión de video con encoder visual MobileNet-V5.
Idiomas
140+
Texto en más de 140 idiomas, con comprensión multimodal en 35. Mejoras fuertes en japonés, alemán, coreano, español y francés.
Licencia
Gemma Terms of Use
Pesos abiertos con uso comercial responsable permitido. Ojo: la familia más nueva Gemma 4 (abril 2026) pasó a Apache 2.0 — 3/3n siguen con términos Gemma.
Precio
Pesos gratis · inferencia $0
Los pesos son gratis en Hugging Face y Kaggle. La inferencia autocontenida no cuesta nada por token — solo pagás tu propio hardware o electricidad.
Una Aclaración Honesta sobre Versiones
Google lanzó Gemma 4 en abril de 2026 (E2B, E4B, 26B MoE, 31B, Apache 2.0) más un modelo unificado 12B multimodal en junio de 2026. Es la familia más nueva — pero Gemma 3/3n sigue siendo la apuesta edge probada con el tooling más amplio: Ollama, llama.cpp, MLX, LiteRT y AI Edge Gallery lo soportan hoy.
2. Qué Mejoró de Verdad vs Gemma 2
Gemma 3 no fue solo un aumento de tamaño. El salto de Gemma 2 a Gemma 3/3n cambió lo que podés shipear en hardware limitado. Estas son las mejoras que verifiqué en la documentación oficial y las model cards:
Parámetros Efectivos (3n)
Per-Layer Embeddings más anidado MatFormer permiten que un modelo de 5B corra con ~2GB (E2B) y uno de 8B con ~3GB (E4B). Calidad de modelo grande con RAM de modelo chico.
Audio Nativo
Gemma 3n es el primer Gemma que escucha: transcripción y traducción de voz en el dispositivo sin internet. Gemma 2 y Gemma 3 base son solo texto/visión.
Visión Móvil Más Rápida
El encoder MobileNet-V5 corre hasta 13x más rápido cuantizado en una TPU de Pixel que el stack visual anterior de Gemma 3, con 46% menos parámetros y 60 fps en video.
Elasticidad Mix-n-Match
Un solo checkpoint E4B se puede recortar en tamaños custom entre E2B y E4B para ajustarse a tu presupuesto de latencia — sin descargas separadas por tamaño.
Calidad Nivel Arena
Gemma 3n E4B superó los 1300 de Elo en LMArena — el primer modelo de menos de 10B parámetros en lograrlo — mientras Gemma 3 27B compite con modelos muy por encima de su peso.
Benchmarks Verificados (model cards oficiales)
Los puntajes vienen de las evaluaciones publicadas por Google a precisión completa. Instruction-tuned donde dice IT, pre-entrenado donde dice PT:
- • HellaSwag 10-shot: 78.6 (E4B PT) · 72.2 (E2B PT)
- • ARC-c 25-shot: 61.6 (E4B PT) · 51.7 (E2B PT)
- • HumanEval 0-shot: 75.0 (E4B IT) · 66.5 (E2B IT)
- • MMLU 0-shot: 64.9 (E4B IT) · 60.1 (E2B IT)
- • WMT24++ traducción (ChrF): 50.1 (E4B IT)
- • MBPP 3-shot: 63.6 (E4B IT) · 56.6 (E2B IT)
3. Quickstart: Corrélo en 5 Minutos
Tenés dos caminos verificados. Ollama es lo más rápido para probarlo ya; transformers te da control multimodal completo (imagen + audio) en Python. Ambos usan los checkpoints oficiales — nada custom.
Paso 1 — Ollama (lo más rápido, texto + visión)
Instalá Ollama desde ollama.com/download, después bajá el build oficial. El tag E2B entra en casi cualquier laptop:
ollama pull gemma3n # effective 2B — huella mínima ollama run gemma3n:e2b # effective 4B — mejor calidad ollama run gemma3n:e4b
Paso 2 — transformers (multimodal completo)
Necesitás transformers 4.53.0 o más nuevo. Este snippet corre el checkpoint oficial E4B con input de imagen, directo de la model card de Hugging Face:
pip install -U transformers
from transformers import pipeline
pipe = pipeline(
"image-text-to-text",
model="google/gemma-3n-e4b-it",
device=0,
)
out = pipe(
"https://huggingface.co/datasets/huggingface/"
"documentation-images/resolve/main/bee.jpg",
text="<image_soft_token> in this image, there is",
)
print(out[0]["generated_text"])Paso 3 — Servílo como API Local
Ollama expone un endpoint local estilo OpenAI, así tu app habla con localhost en vez de una API cloud. Verificado contra la guía oficial de integración con Ollama:
curl http://localhost:11434/api/generate -d '{
"model": "gemma3n",
"prompt": "resumí esta release note en 3 bullets"
}'Tip: Elegí Bien el Tamaño al Primer Intento
Teléfono o Raspberry Pi 5 8GB: arrancá con gemma3n:e2b (~2GB efectivos). Laptop con 16GB: directo a E4B. Desktop con GPU: Gemma 3 12B es el salto de calidad. Podés hacer Mix-n-Match entre E2B y E4B después sin re-descargar.
4. Límites Honestos
Corro modelos chicos en hardware real, así que esto es lo que los anuncios minimizan. Nada de esto es un dealbreaker — pero tenés que saberlo antes de arquitecturar sobre Gemma 3n:
✅ Dónde Brilla
- • Apps offline-first: chat, resumen y RAG con cero costo por token
- • Multimodal móvil: captioning, preguntas visuales y transcripción en el dispositivo
- • Apps con datos sensibles: salud, chicos, datos enterprise que no pueden salir del dispositivo
- • Prototipar features multimodales sin factura de API
- • Fine-tuning de un modelo compacto para una tarea de dominio
❌ Dónde Sufre
- • Razonamiento pesado y matemática de competencia: AIME 2025 en 11.6 (E4B) — mejor un modelo cloud frontier
- • Contexto largo más allá de 32K en 3n: Gemma 3 4B+ te da 128K, 3n no
- • Ollama en Pi expone solo texto: el multimodal completo requiere el pipeline de transformers, más lento en ARM
- • Corte de conocimiento junio 2024: lo más nuevo requiere retrieval o un checkpoint más reciente
- • Multimodal con poca RAM: cargar los parámetros de visión/audio sube la huella real sobre los 2–3GB del titular
Regla de oro
Elegí el modelo según la restricción, no según el hype. Si tu app tiene que funcionar en un avión, un hospital o una placa de 60 dólares, Gemma 3n es la mejor opción abierta que probé. Si necesitás razonamiento frontier, pagá la nube — ningún modelo de 4B te va a salvar.
5. Veredicto: ¿Conviene Construir Sobre Él?
Sí — si tu restricción es el dispositivo, no el datacenter. Gemma 3n E2B es mi recomendación default para todo lo que tenga que correr offline en un teléfono o una Raspberry Pi 5: carga rápido, deja RAM libre y sus ~6 tokens/seg en una Pi 5 alcanzan para tareas background, asistentes y parsing de smart-home.
Para laptops, subí a E4B o Gemma 3 4B QAT. Para máxima calidad en servidor, Gemma 3 27B — o evaluá la familia más nueva Gemma 4 bajo Apache 2.0. El momentum del Gemmaverse (400M+ descargas, 100K+ variantes) hace que los fine-tunes y el tooling sigan creciendo.
Mi Veredicto
Gemma 3n es el primer modelo abierto que hace que lo multimodal en el dispositivo se sienta práctico en vez de experimental. Corré el quickstart de Ollama esta noche — en 10 minutos vas a saber si encaja en tu app.
Conclusión
La familia Gemma 3 — y sobre todo 3n — movió la frontera de la nube a tu bolsillo. Tamaños realistas, inputs multimodales reales y una licencia que permite uso comercial lo hacen la opción abierta más shipeable para edge AI en 2026.
Arrancá con la corrida de 5 minutos en Ollama, después profundizá con transformers cuando necesites visión y audio. Y si 3n te queda chico, el camino a Gemma 4 ya está pavimentado con el mismo tooling.
Machete: Resumen
Corrélo
- • ollama run gemma3n:e2b (teléfono / Pi)
- • ollama run gemma3n:e4b (laptop)
- • transformers ≥ 4.53.0 (multimodal)
Recordá
- • E2B ≈ 2GB · E4B ≈ 3GB efectivos
- • 32K contexto · 140+ idiomas
- • Corte junio 2024 — sumá RAG
Próximos Pasos
- • AI Edge Gallery (demo en Android)
- • LiteRT / Google AI Edge (shipeálo)
- • Evaluá Gemma 4 (Apache 2.0)



