Desarrollo IAOpen Source

Qwen3.8-Flash: ficha, benchmarks y guía local

3 de septiembre de 2026
11 min de lectura
Guía de benchmarks y setup local del MoE abierto Qwen3.8-Flash
Compartir:

El equipo Qwen de Alibaba siguió su lanzamiento de Qwen3.8-27B (14 de agosto) con Qwen3.8-Flash-Next (26 de agosto): un MoE de 125B con 6B activos por token que anticipa la arquitectura de Qwen4, servido gestionado como Qwen3.8-Flash con 1M de contexto por defecto. Contrasté las afirmaciones con las model cards oficiales para que no tengas que hacerlo vos.

En esta guía tenés la ficha Flash verificada, los deltas reales de benchmarks contra el ancla de 27B, un quickstart funcional con Ollama y vLLM, los límites honestos y mi veredicto sobre quién debería adoptarlo — más una nota sobre el snapshot Max-0902 del 2 de septiembre.

1. Ficha técnica: qué es Qwen3.8-Flash

Qwen3.8-Flash-Next es el MoE de pesos abiertos de la familia Qwen3.8, publicado el 26 de agosto de 2026 en Hugging Face (Qwen/Qwen3.8-Flash-Next, más variante oficial FP8) y ModelScope. Es multimodal nativo (texto más visión) y anticipa la arquitectura de Qwen4. Qwen3.8-Flash es su versión gestionada productiva — 1M de contexto por defecto con herramientas oficiales. El denso de 27B queda en esta guía como ancla auto-hosteable.

Parámetros

125B MoE principal (6B activos/token, 512 expertos) + 51B n-gram embeddings + 4B MTP

Contexto

262.144 tokens nativos, extensible a 1M vía YaRN; el Flash gestionado trae 1M por defecto

Modalidad

Multimodal nativo: texto + comprensión de imagen y video

Licencia

Qwen Community License 1.0 — pesos abiertos, no Apache 2.0 (el ancla de 27B sigue Apache 2.0)

Precio API

qwen3.8-flash en QwenCloud: $0,16 por 1M de input / $0,47 por 1M de output

Ancla 27B

Qwen3.8-27B: 27B denso, Apache 2.0, 262K de contexto — la carta a batir abajo

Matiz de licencia que vale saber

Flash-Next usa la Qwen Community License 1.0, con cláusulas de naming y MaaS — no es Apache 2.0. El ancla de 27B sí es Apache 2.0, con el archivo en su repo. Tratalos por separado en revisiones de compliance.

Sobre el precio

Auto-hostear Flash-Next te cuesta servidores, no tokens — el checkpoint completo pesa ~335 GB (FP8 ~173 GB) y la tabla n-gram de 51B vive en host memory con prefetch async. La API gestionada qwen3.8-flash a $0,16/$0,47 por 1M de tokens es la forma barata de probarlo — revisá siempre la consola por promos vigentes antes de presupuestar.

2. Qué mejora contra el ancla de 27B

La model card oficial de Flash-Next lo puntúa contra Qwen3.8-27B, Qwen3.7-Plus y Claude Opus 4.6 (Max) en los mismos harnesses. El patrón es consistente: Flash-Next supera a su hermano de 27B en todos los benches publicados, con los gaps grandes en coding agéntico profundo y trabajo profesional de oficina.

📈

DeepSWE 1.1

42,2 (Qwen3.8-27B)58,7

El coding agéntico profundo sube 16 puntos — el número titular para builders de agentes, por encima del 27B en ambos harnesses.

📈

SWE-bench Pro

61,7 (Qwen3.8-27B)62,5

La ingeniería de software real pasa al 27B y supera a Claude Opus 4.6 Max con 53,4.

📈

SWE-bench Multilingual

73,8 (Qwen3.8-27B)81,0

El trabajo multilingüe en repos gana 7 puntos y supera a Opus 4.6 Max con 77,5.

📈

CoWorkBench

70,7 (Qwen3.8-27B)73,9

Los flujos de oficina de largo horizonte mejoran de nuevo — relevante si automatizás documentos y ops.

📈

JobBench

33,4 (Qwen3.8-27B)55,7

Las tareas profesionales saltan 22 puntos, lejos de Qwen3.7-Plus con 27,6 y de Opus 4.6 Max con 36,6.

📈

LiveCodeBench v6

90,3 (Qwen3.8-27B)91,9

El código competitivo llega a 91,9, por encima del 27B y de DeepSeek-V4-Flash con 90,6.

¿Y el snapshot Max-0902?

El 2 de septiembre Alibaba cortó qwen3.8-max-0902, un snapshot fechado de Qwen3.8-Max (alias qwen3.8-max-2026-09-02) a $2 de input / $6 de output por 1M de tokens. Está vivo en DashScope/QwenCloud, pero los agregadores terceros aún no lo listaban — tratalo como solo-gestionado hasta que tu proveedor lo publique. Flash sigue siendo el tier costo-eficiente a ~una décima del precio de input.

3. Quickstart: corrélo en local en minutos

Tres caminos verificados, del más fácil al más controlable. Todos los comandos salen de la model card oficial de Flash-Next, el repo y la librería de Ollama — sin flags inventados.

Opción A — Ollama (lo más fácil, build cuantizado NVFP4)

ollama run qwen3.8-flash-next:125b-a6b-nvfp4

# chat por API cuando ya está sirviendo:
curl http://localhost:11434/api/chat \
  -d ’{
    "model": "qwen3.8-flash-next:125b-a6b-nvfp4",
    "messages": [{"role": "user", "content": "Hello!"}]
  }’

Opción B — vLLM (serving productivo, 262K de contexto)

vllm serve Qwen/Qwen3.8-Flash-Next --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice --tool-call-parser qwen3_coder

Opción C — SDK compatible con OpenAI (Flash gestionado en QwenCloud)

from openai import OpenAI

client = OpenAI(
    api_key="sk-xxx",  # o os.getenv("DASHSCOPE_API_KEY")
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[{"role": "user", "content": "Refactorizá esta función."}],
    extra_body={"enable_thinking": True},
    reasoning_effort="xhigh",
    stream=True,
)

Parámetros de muestreo que importan

El thinking viene activado por defecto en esfuerzo xhigh; medium y low cambian profundidad por velocidad. Mantené temperature 1.0, top_p 0.95 para runs con thinking. Preferí el checkpoint FP8 (Qwen/Qwen3.8-Flash-Next-FP8) con tensor-parallel 4 para serving.

Tip: planificá la memoria antes de servir

Presupuestá ~335 GB para BF16 o ~173 GB para FP8, más 51 GB de host memory para el offload n-gram — TP4 es la forma recomendada. Para 1M aplicá los overrides YaRN de la card. Si es demasiado fierro, la API gestionada qwen3.8-flash o el ancla de 27B es la salida sana.

4. Límites honestos

Ningún modelo es gratis, y la propia card insinúa los trade-offs. Esto es lo que hay que mirar antes de apostar un proyecto a Qwen3.8-Flash.

⚠️

125B pide fierro de servidor, no workstation

El checkpoint completo pesa ~335 GB (FP8 ~173 GB) con TP4 recomendado y 51 GB de host memory para el offload n-gram. Esto es territorio multi-GPU de servidor — probá primero el quant de Ollama o la API gestionada.

⚠️

Licencia Community, no Apache 2.0

Flash-Next trae la Qwen Community License 1.0 con cláusulas de naming y MaaS. Si tu política exige Apache 2.0, el ancla de 27B es la opción compliant.

⚠️

En HLE sigue detrás del frontier

Humanity's Last Exam pasa 30,8 → 35,9 pero queda detrás de Claude Opus 4.6 Max con 40,0. Para razonamiento científico duro, Flash es mejor valor, no mejor pico.

⚠️

El thinking en xhigh cuesta latencia

El razonamiento viene activado por defecto en esfuerzo xhigh. Las cadenas agénticas largas son potentes pero lentas y caras en tokens — bajá a medium o low cuando quieras velocidad sobre profundidad.

⚠️

El contexto de 1M exige cirugía YaRN

Los pesos abiertos sirven 262K nativos; más allá tenés que aplicar los overrides de rope a mano. Solo el qwen3.8-flash gestionado te da 1M por defecto.

Lo que yo no haría

No auto-hostearía Flash-Next sin cotizar la API gestionada contra tu volumen — a $0,16/$0,47 por 1M de tokens es difícil de batir para trabajo esporádico. Y no reemplazaría tu harness de evals solo con las tablas del vendor — reproducí DeepSWE y SWE-bench Pro en tus propias tareas antes de migrar agentes productivos.

5. Veredicto: quién debería adoptarlo

Si corrés agentes de código de alto volumen o flujos tool-driven, Qwen3.8-Flash es la historia de costo-eficiencia más convincente de este ciclo: supera al 27B en todos los scores, con 6B activos por token y pricing gestionado a ~una décima del Max. El ancla de 27B queda como pick cuando necesitás Apache 2.0 o un setup de una sola máquina.

Si solo necesitás un chat barato o ya servís el 27B contento para Q&A, Flash no te cambia la vida — te compra profundidad agéntica a escala de servidor, no menor footprint. Para el resto de los que shippean agentes en volumen: probá la API gestionada esta misma tarde, medila en tu repo y recién ahí decidí el self-hosting.

Mi decisión

Adopción con medición para builders de agentes de alto volumen (gestionado primero), ancla de 27B para Apache-2.0 o single-box. Flash se gana su lugar como el Qwen default para agentes de código costo-conscientes en 2026.

Conclusión

Qwen3.8-Flash empaqueta las dos cosas que los equipos de agentes quieren: mejores números en coding agéntico que el 27B a una fracción del precio del Max. Tené presentes los términos de la licencia Community, dimensioná tus servidores con honestidad y dejá que tus propios benchmarks tengan la última palabra.

Todos los números de arriba salen de las fuentes oficiales de Qwen linkeadas abajo — sin scores inventados ni hype prestado. Si lo corrés en local o vía la API gestionada, me encantaría saber cómo se comporta en tu stack.

Machete

  • • 125B MoE (6B activos) + tabla n-gram 51B, Community 1.0, 262K nativos
  • • DeepSWE 58,7, SWE-bench Pro 62,5, JobBench 55,7 — todos superan al 27B
  • • qwen3.8-flash gestionado: $0,16/$0,47 por 1M; el 27B sigue el pick Apache
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego