Desarrollo IA

Qwen3.8 Flash: probé el modelo veloz de Alibaba

12 de septiembre de 2026
9 min de lectura
Qwen3.8 Flash, el modelo veloz probado para agentes de código
Compartir:

El 26 de agosto de 2026, el equipo Qwen de Alibaba lanzó Qwen3.8-Flash: un MoE de 125B con solo 6B activos por token que entrena a ~un noveno del costo de Qwen3.7-Plus y sirve agentes a ~el doble de velocidad de generación. Los pesos abiertos (Qwen3.8-Flash-Next) son públicos, y la API gestionada cuesta $0,16 por 1M de tokens de input.

Leí el release, la model card y el archivo de licencia para que no tengas que hacerlo vos. Abajo: la ficha del tier veloz, qué mejora de verdad contra Qwen3, un quickstart funcional con Ollama/vLLM, los límites honestos y mi veredicto sobre quién debería correr agentes encima.

1. Ficha técnica: el tier veloz de Qwen3.8

Flash no es el flagship — ese es Qwen3.8-Max. Flash es el tier de throughput: casi toda la calidad agéntica a ~una doceava parte del precio, sobre un anticipo de la arquitectura de Qwen4. El artefacto abierto es Qwen3.8-Flash-Next (Hugging Face + ModelScope); Qwen3.8-Flash es la versión gestionada productiva con 1M de contexto por defecto y herramientas oficiales.

Parámetros

125B MoE principal (6B activos/token, 512 expertos) + tabla n-gram 51B + head MTP 4B

Contexto

262.144 tokens nativos, extensible a 1M vía YaRN; el Flash gestionado trae 1M por defecto

Modalidad

Multimodal nativo: texto más comprensión de imagen y video

Licencia

Qwen Community License 1.0 — pesos abiertos, NO Apache 2.0 (solo el denso de 27B es Apache 2.0)

Precio API

qwen3.8-flash gestionado: $0,16 por 1M de input / $0,47 por 1M de output

Lanzamiento

26 de agosto de 2026 — doce días después del denso Qwen3.8-27B Apache-2.0

Licencia: verificada, e importa

Revisé la model card: Flash-Next usa la Qwen Community License 1.0 (figura como “other” en Hugging Face), con deber de naming pasando los 100M de MAU y licencia comercial separada para productos MaaS o de asistente de trabajo IA. El hermano denso de 27B sí es Apache 2.0 liso. No los trates como la misma licencia.

La cuenta para workloads de agentes

A $0,16/$0,47 por 1M de tokens, el Flash gestionado es ~12x más barato que Max ($2/$6) en input y output. El modo estándar rediseñado de QwenWork sobre Flash recorta 75% los tokens por tarea y ~duplica la velocidad de generación — para agentes multi-paso, eso compone el Qwen más barato por tarea completada.

2. Qué mejora contra Qwen3

La card oficial de Flash-Next lo puntúa contra Qwen3.7-Plus (la referencia veloz anterior), el denso de 27B, DeepSeek-V4-Flash y Claude Opus 4.6 Max. Todos los números son vendor-reported — sin auditoría independiente al publicar — pero la forma es lo que importa para agentes: las tareas profundas de código y oficina saltan mientras el cómputo activo baja.

📈

DeepSWE 1.1: 16,5 → 58,7

Qwen3.7-Plus con 16,558,7

El coding agéntico profundo más que triplica contra la generación anterior y supera a DeepSeek-V4-Flash con 54,4. El titular para builders de agentes.

📈

SWE-bench Pro: 55,8 → 62,5

Qwen3.7-Plus con 55,862,5

La ingeniería de software real pasa a Claude Opus 4.6 Max con 53,4 usando 6B activos por token en vez de un modelo tamaño frontier.

📈

CoWorkBench: 65,1 → 73,9

Qwen3.7-Plus con 65,173,9

Los flujos de oficina de largo horizonte mejoran ~9 puntos y superan a Opus 4.6 Max con 68,2 — el número del modo estándar de QwenWork tiene bench detrás.

📈

JobBench: 27,6 → 55,7

Qwen3.7-Plus con 27,655,7

Las tareas profesionales se duplican contra Qwen3 y quedan lejos de Opus 4.6 Max con 36,6. Los roles tool-heavy ganan más.

📈

Costo de entreno: 1/9 de Qwen3.7-Plus

Baseline Qwen3.7-Plus~1/9 de FLOPs de entreno

Igual o mejor calidad a ~un noveno del cómputo de entreno, vía Gated DeltaNet más retrieval disperso QSA. La eficiencia es el feature.

📈

Parámetros activos: 17B → 6B

Qwen3.7-Plus con 17B activos6B activos

Casi 3x menos parámetros activos por token para mejores scores — el decode sale barato mientras el backbone de 512 expertos guarda el conocimiento.

Dónde queda el denso de 27B

Qwen3.8-27B (14 de ago, Apache 2.0) sigue siendo el pick single-box: 61,7 en SWE-bench Pro con quants clase 17GB. Flash-Next lo supera en todo (62,5, 58,7 DeepSWE, 73,9 CoWorkBench) pero pide fierro de servidor. Mi guía hermana cubre el 27B en profundidad — este post se queda en el tier veloz.

3. Quickstart: servilo para agentes en minutos

Tres caminos verificados, del más rápido primero. Los comandos salen del repo oficial, la model card y la librería de Ollama — sin flags inventados. Para agentes, el camino vLLM con parsers de tool-calling es el que importa.

Opción A — Ollama (prueba local más rápida)

ollama run qwen3.8-flash-next

# chat por API cuando ya está sirviendo:
curl http://localhost:11434/api/chat \
  -d ’{
    "model": "qwen3.8-flash-next",
    "messages": [{"role": "user", "content": "Hello!"}]
  }’

Opción B — vLLM (serving de agentes con tools, 262K de contexto)

vllm serve Qwen/Qwen3.8-Flash-Next --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice --tool-call-parser qwen3_coder

Opción C — API Flash gestionada (más barata por tarea)

from openai import OpenAI

client = OpenAI(
    api_key="sk-xxx",  # o os.getenv("DASHSCOPE_API_KEY")
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[{"role": "user", "content": "Corregí el test que falla en repo.py."}],
    extra_body={"enable_thinking": True},
    reasoning_effort="low",  # low = loops de agente rápidos, xhigh = profundo
    stream=True,
)

Tuning de agentes que importa

El thinking viene activado por defecto: dejá xhigh para tareas duras multi-paso, bajá a low o medium para loops rápidos de tools. Mantené temperature 1.0 y top_p 0.95 en runs con thinking. El head MTP de 1 capa habilita speculative decoding en engines compatibles — latencia gratis en decode agéntico.

Tip: empezá gestionado, auto-hosteá después

Auto-hostear pide ~335 GB (BF16) o ~173 GB (FP8) más 51 GB de host memory para el offload n-gram en TP4. Salvo que ya tengas el fierro, quemá primero la API gestionada a $0,16/$0,47 y medí tokens por tarea completada — esa es la métrica que decide el self-host.

4. Límites honestos

Flash es un tier de velocidad, no de milagros. Esto es lo que hay que revisar antes de rutear agentes productivos por acá.

⚠️

La cláusula MaaS muerde a vendors de agentes

La Community License 1.0 exige licencia comercial separada si corrés un producto Model-as-a-Service o de asistente de trabajo IA sobre estos pesos — sin umbral de tamaño. Los agentes internos están exceptuados; vender inferencia o un asistente de código encima, no.

⚠️

Fierro de servidor, no workstation

Checkpoint completo ~335 GB (FP8 ~173 GB), TP4 recomendado, 51 GB de host memory para la tabla n-gram. Las recetas comunitarias reportan ~24 tok/s single-node y ~1.430 tok/s a concurrencia 64 en 4xH100 — con los flags de offload bien puestos.

⚠️

El 1M auto-hosteado exige cirugía YaRN

Los pesos abiertos sirven 262K nativos; más allá aplicás a mano los overrides de rope de la card (factor 4.0 para 1M). Solo el Flash gestionado te da 1M por defecto.

⚠️

El thinking en xhigh cuesta latencia

El esfuerzo de razonamiento default es xhigh — gran profundidad, loops lentos. Los harnesses que lo dejan por defecto pagan en tokens y segundos; tunealo por tarea.

⚠️

Los titulares son vendor-reported

Los deltas de DeepSWE, SWE-bench Pro y CoWorkBench salen de la card del propio Qwen. Sin auditoría independiente al publicar. Reproducí dos benches en tus propios repos antes de migrar.

Lo que yo no haría

No shippearía un asistente de código comercial sobre los pesos Flash-Next sin limpiar la licencia Community primero — esa cláusula se escribió para exactamente ese producto. Y no auto-hostearía sin medir tokens-por-tarea en gestionado; el recorte del 75% en modo QwenWork es difícil de batir con fierro propio.

5. Veredicto: quién debería adoptarlo

Si corrés agentes de código o de tareas de oficina en alto volumen, Flash es hoy la mejor historia de costo-por-tarea-completada del lineup Qwen: mejores benches agénticos que Qwen3 con 6B activos, ~12x más barato que Max, y un tier gestionado que te saca el serving de encima. Empezá en la API con reasoning_effort low y medí.

Si necesitás Apache 2.0, quedate en el denso de 27B. Si necesitás una GPU y simplicidad, quedate en los GGUF del 27B. Flash te compra throughput agéntico a escala de servidor — no menor footprint ni licencia permisiva.

Mi decisión

Adopción con medición para builders de agentes en la API gestionada; self-host solo con fierro clase TP4 y licencia limpia. Flash es el Qwen default para agentes costo-conscientes en 2026 — el 27B hermano sigue siendo el default para todo lo demás.

Conclusión

Qwen3.8 Flash es Alibaba haciendo lo que el nombre Flash promete: 6B activos por token, un noveno del costo de entreno, loops agénticos más rápidos y scores de oficina que superan a modelos muy por encima de su precio. El trade es complejidad de licencia y serving a escala de servidor.

Cada número de arriba sale de las fuentes oficiales de abajo — vendor-reported donde corresponde, con los gaps marcados, no escondidos. Si lo corrés en tu stack de agentes, quiero saber tus tokens-por-tarea.

Machete

  • • 125B MoE, 6B activos, 262K nativos → 1M YaRN; Community 1.0, no Apache
  • • DeepSWE 58,7, SWE-bench Pro 62,5, JobBench 55,7 — todos vs Qwen3.7-Plus
  • • Gestionado $0,16/$0,47 por 1M; modo QwenWork: 75% menos tokens, ~2x vel.
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego