Desarrollo IAEdge AI

Gemma 3 para Edge AI: Ficha, Benchmarks y Quickstart

15 de agosto de 2026
9 min de lectura
Gemma 3 corriendo en dispositivos edge
Compartir:

La mayoría de los modelos abiertos asumen que tenés un servidor. La familia Gemma 3 de Google apuesta lo contrario: IA capaz que corre en tu teléfono, tu laptop o una Raspberry Pi de 60 dólares. Las variantes 3n van más lejos, metiendo texto, visión y audio en 2GB de memoria.

En esta guía desarmo la ficha real, qué mejoró de verdad vs Gemma 2, benchmarks verificados y un quickstart de 5 minutos con Ollama y transformers para correrlo en local hoy mismo.

1. La Ficha: Gemma 3 y 3n de un Vistazo

Gemma 3 salió el 12 de marzo de 2025 en cinco tamaños, y Gemma 3n llegó con release completo el 26 de junio de 2025 como la rama mobile-first de la familia. Ambos son modelos de pesos abiertos construidos con el mismo research detrás de Gemini. Esta es la ficha que importa para builders:

📦

Parámetros

Gemma 3 · Gemma 3n

Gemma 3: 270M, 1B, 4B, 12B, 27B. Gemma 3n: E2B (5B reales, ~2B efectivos) y E4B (8B reales, ~4B efectivos) gracias a anidado MatFormer y cacheo Per-Layer Embedding.

📏

Contexto

32K · 128K

128K tokens para Gemma 3 4B/12B/27B, 32K para 1B/270M y ambas variantes 3n. Suficiente para documentos largos y conversaciones multi-imagen en el dispositivo.

👁️

Modalidades

Texto · Imagen · Audio · Video

Gemma 3 maneja texto + imágenes. Gemma 3n suma audio (transcripción y traducción de voz) y comprensión de video con encoder visual MobileNet-V5.

🌍

Idiomas

140+

Texto en más de 140 idiomas, con comprensión multimodal en 35. Mejoras fuertes en japonés, alemán, coreano, español y francés.

📜

Licencia

Gemma Terms of Use

Pesos abiertos con uso comercial responsable permitido. Ojo: la familia más nueva Gemma 4 (abril 2026) pasó a Apache 2.0 — 3/3n siguen con términos Gemma.

💰

Precio

Pesos gratis · inferencia $0

Los pesos son gratis en Hugging Face y Kaggle. La inferencia autocontenida no cuesta nada por token — solo pagás tu propio hardware o electricidad.

Una Aclaración Honesta sobre Versiones

Google lanzó Gemma 4 en abril de 2026 (E2B, E4B, 26B MoE, 31B, Apache 2.0) más un modelo unificado 12B multimodal en junio de 2026. Es la familia más nueva — pero Gemma 3/3n sigue siendo la apuesta edge probada con el tooling más amplio: Ollama, llama.cpp, MLX, LiteRT y AI Edge Gallery lo soportan hoy.

2. Qué Mejoró de Verdad vs Gemma 2

Gemma 3 no fue solo un aumento de tamaño. El salto de Gemma 2 a Gemma 3/3n cambió lo que podés shipear en hardware limitado. Estas son las mejoras que verifiqué en la documentación oficial y las model cards:

🧠

Parámetros Efectivos (3n)

Per-Layer Embeddings más anidado MatFormer permiten que un modelo de 5B corra con ~2GB (E2B) y uno de 8B con ~3GB (E4B). Calidad de modelo grande con RAM de modelo chico.

🎙️

Audio Nativo

Gemma 3n es el primer Gemma que escucha: transcripción y traducción de voz en el dispositivo sin internet. Gemma 2 y Gemma 3 base son solo texto/visión.

🖼️

Visión Móvil Más Rápida

El encoder MobileNet-V5 corre hasta 13x más rápido cuantizado en una TPU de Pixel que el stack visual anterior de Gemma 3, con 46% menos parámetros y 60 fps en video.

🔀

Elasticidad Mix-n-Match

Un solo checkpoint E4B se puede recortar en tamaños custom entre E2B y E4B para ajustarse a tu presupuesto de latencia — sin descargas separadas por tamaño.

🏆

Calidad Nivel Arena

Gemma 3n E4B superó los 1300 de Elo en LMArena — el primer modelo de menos de 10B parámetros en lograrlo — mientras Gemma 3 27B compite con modelos muy por encima de su peso.

Benchmarks Verificados (model cards oficiales)

Los puntajes vienen de las evaluaciones publicadas por Google a precisión completa. Instruction-tuned donde dice IT, pre-entrenado donde dice PT:

  • HellaSwag 10-shot: 78.6 (E4B PT) · 72.2 (E2B PT)
  • ARC-c 25-shot: 61.6 (E4B PT) · 51.7 (E2B PT)
  • HumanEval 0-shot: 75.0 (E4B IT) · 66.5 (E2B IT)
  • MMLU 0-shot: 64.9 (E4B IT) · 60.1 (E2B IT)
  • WMT24++ traducción (ChrF): 50.1 (E4B IT)
  • MBPP 3-shot: 63.6 (E4B IT) · 56.6 (E2B IT)

3. Quickstart: Corrélo en 5 Minutos

Tenés dos caminos verificados. Ollama es lo más rápido para probarlo ya; transformers te da control multimodal completo (imagen + audio) en Python. Ambos usan los checkpoints oficiales — nada custom.

Paso 1 — Ollama (lo más rápido, texto + visión)

Instalá Ollama desde ollama.com/download, después bajá el build oficial. El tag E2B entra en casi cualquier laptop:

ollama pull gemma3n

# effective 2B — huella mínima
ollama run gemma3n:e2b

# effective 4B — mejor calidad
ollama run gemma3n:e4b

Paso 2 — transformers (multimodal completo)

Necesitás transformers 4.53.0 o más nuevo. Este snippet corre el checkpoint oficial E4B con input de imagen, directo de la model card de Hugging Face:

pip install -U transformers

from transformers import pipeline

pipe = pipeline(
    "image-text-to-text",
    model="google/gemma-3n-e4b-it",
    device=0,
)

out = pipe(
    "https://huggingface.co/datasets/huggingface/"
    "documentation-images/resolve/main/bee.jpg",
    text="<image_soft_token> in this image, there is",
)
print(out[0]["generated_text"])

Paso 3 — Servílo como API Local

Ollama expone un endpoint local estilo OpenAI, así tu app habla con localhost en vez de una API cloud. Verificado contra la guía oficial de integración con Ollama:

curl http://localhost:11434/api/generate -d '{
  "model": "gemma3n",
  "prompt": "resumí esta release note en 3 bullets"
}'

Tip: Elegí Bien el Tamaño al Primer Intento

Teléfono o Raspberry Pi 5 8GB: arrancá con gemma3n:e2b (~2GB efectivos). Laptop con 16GB: directo a E4B. Desktop con GPU: Gemma 3 12B es el salto de calidad. Podés hacer Mix-n-Match entre E2B y E4B después sin re-descargar.

4. Límites Honestos

Corro modelos chicos en hardware real, así que esto es lo que los anuncios minimizan. Nada de esto es un dealbreaker — pero tenés que saberlo antes de arquitecturar sobre Gemma 3n:

✅ Dónde Brilla

  • Apps offline-first: chat, resumen y RAG con cero costo por token
  • Multimodal móvil: captioning, preguntas visuales y transcripción en el dispositivo
  • Apps con datos sensibles: salud, chicos, datos enterprise que no pueden salir del dispositivo
  • Prototipar features multimodales sin factura de API
  • Fine-tuning de un modelo compacto para una tarea de dominio

❌ Dónde Sufre

  • Razonamiento pesado y matemática de competencia: AIME 2025 en 11.6 (E4B) — mejor un modelo cloud frontier
  • Contexto largo más allá de 32K en 3n: Gemma 3 4B+ te da 128K, 3n no
  • Ollama en Pi expone solo texto: el multimodal completo requiere el pipeline de transformers, más lento en ARM
  • Corte de conocimiento junio 2024: lo más nuevo requiere retrieval o un checkpoint más reciente
  • Multimodal con poca RAM: cargar los parámetros de visión/audio sube la huella real sobre los 2–3GB del titular

Regla de oro

Elegí el modelo según la restricción, no según el hype. Si tu app tiene que funcionar en un avión, un hospital o una placa de 60 dólares, Gemma 3n es la mejor opción abierta que probé. Si necesitás razonamiento frontier, pagá la nube — ningún modelo de 4B te va a salvar.

5. Veredicto: ¿Conviene Construir Sobre Él?

Sí — si tu restricción es el dispositivo, no el datacenter. Gemma 3n E2B es mi recomendación default para todo lo que tenga que correr offline en un teléfono o una Raspberry Pi 5: carga rápido, deja RAM libre y sus ~6 tokens/seg en una Pi 5 alcanzan para tareas background, asistentes y parsing de smart-home.

Para laptops, subí a E4B o Gemma 3 4B QAT. Para máxima calidad en servidor, Gemma 3 27B — o evaluá la familia más nueva Gemma 4 bajo Apache 2.0. El momentum del Gemmaverse (400M+ descargas, 100K+ variantes) hace que los fine-tunes y el tooling sigan creciendo.

Mi Veredicto

Gemma 3n es el primer modelo abierto que hace que lo multimodal en el dispositivo se sienta práctico en vez de experimental. Corré el quickstart de Ollama esta noche — en 10 minutos vas a saber si encaja en tu app.

Conclusión

La familia Gemma 3 — y sobre todo 3n — movió la frontera de la nube a tu bolsillo. Tamaños realistas, inputs multimodales reales y una licencia que permite uso comercial lo hacen la opción abierta más shipeable para edge AI en 2026.

Arrancá con la corrida de 5 minutos en Ollama, después profundizá con transformers cuando necesites visión y audio. Y si 3n te queda chico, el camino a Gemma 4 ya está pavimentado con el mismo tooling.

Machete: Resumen

Corrélo

  • • ollama run gemma3n:e2b (teléfono / Pi)
  • • ollama run gemma3n:e4b (laptop)
  • • transformers ≥ 4.53.0 (multimodal)

Recordá

  • • E2B ≈ 2GB · E4B ≈ 3GB efectivos
  • • 32K contexto · 140+ idiomas
  • • Corte junio 2024 — sumá RAG

Próximos Pasos

  • • AI Edge Gallery (demo en Android)
  • • LiteRT / Google AI Edge (shipeálo)
  • • Evaluá Gemma 4 (Apache 2.0)
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego