A fines de abril de 2026 Mistral AI lanzó Medium 3.5, un modelo denso de 128B que combina instruction-following, razonamiento y código en un solo set de pesos abiertos. Desde mayo es el modelo por defecto en Le Chat y potencia los agentes remotos de código en Mistral Vibe.
En esta guía desgloso la ficha técnica verificada, qué mejora de verdad frente a Medium 3 y Devstral 2, el precio real de la API y un quickstart de 5 minutos — más los límites honestos que conviene conocer antes de apostar un workload productivo.
1. Qué lanzó Mistral en realidad
Mistral Medium 3.5 es el primer flagship merged de la compañía: un checkpoint denso de 128B con 256K de contexto que resuelve chat, razonamiento y coding agéntico sin cambiar de modelo. Mistral entrenó el vision encoder desde cero para tamaños de imagen variables, y el esfuerzo de razonamiento ahora se configura por request — el mismo modelo responde un chat rápido o trabaja un run largo con muchas herramientas.
Matiz de licencia: Modified MIT ≠ Apache 2.0
Medium 3.5 se publica como open weights bajo licencia Modified MIT, no Apache 2.0 como Large 3. Para la mayoría de los builds sigue siendo permisiva, pero a los abogados de empresa les importa la diferencia: leé los términos exactos del model card antes de asumir condiciones de self-hosting idénticas a Large 3.
Por qué importa para equipos enterprise: tenés un vendor europeo con datacenters en la UE, pesos abiertos que podés self-hostear desde cuatro GPUs, y una API gestionada bajo el ID mistral-medium-latest. Ese trío — historia de soberanía, opción de salida y API gestionada — es justo lo que piden las checklists de compras.
2. Ficha técnica
Todo lo de abajo sale del model card oficial y la página de precios de Mistral, no de rumores de terceros. Es la ficha que podés pegar en un architecture decision record.
Parámetros
denso · 128B
Un solo modelo denso de 128B que fusiona instruction-following, razonamiento y código. Sin ruteo MoE que tunear ni checkpoint de razonamiento separado.
Contexto
256K tokens
Ventana de 256K con structured outputs, function calling, document QnA y soporte de la API de Agents & Conversations.
Licencia
Modified MIT · open weights
Pesos abiertos en Hugging Face bajo licencia Modified MIT. También servido en NVIDIA NIM y build.nvidia.com para prototipar.
Precio API
La Plateforme · por 1M tokens
$1.5 input / $7.5 output por millón de tokens vía el ID mistral-medium-latest. Batch descuenta 50%, inputs cacheados hasta 90%.
Self-host
4+ GPUs
Mistral reporta self-hosting desde apenas cuatro GPUs. Compará con el footprint MoE de 675B de Large 3 antes de dimensionar hardware.
Benchmarks
blog oficial · mayo 2026
77.6% en SWE-Bench Verified — por encima de Devstral 2 y Qwen3.5 397B A17B según Mistral — más 91.4 en τ³-Telecom para llamadas agénticas.
La cuenta empresarial
A $1.5/$7.5 cuesta 3x la tarifa $0.5/$1.5 de Large 3 — pagás el premium por confiabilidad agéntica, no por chat crudo. Ruteá clasificación y extracción a Small 4 ($0.15/$0.6) o Ministral 3B ($0.1/$0.1) y reservá Medium 3.5 para runs multi-herramienta donde los reintentos son el costo real.
3. Qué mejora frente a la generación anterior
Medium 3.5 no reemplaza todo el lineup — ocupa el slot agéntico tope de gama. Así se mapea contra lo que vino antes.
🆚 vs Medium 3 y Devstral 2
Un modelo en vez de dos
Medium 3 cubría chat general mientras Devstral 2 era dueño de los coding agents. Medium 3.5 fusiona ambos y reemplaza a Devstral 2 dentro del CLI de Vibe.
SWE-Bench Verified: 77.6%
El número titular de Mistral supera a Devstral 2 sin discusión. Si tu cuello de botella es la tasa de éxito del agente en repos reales, este es el upgrade que mueve la métrica.
Esfuerzo de razonamiento configurable
El control de razonamiento por request permite servir chat rápido y runs agénticos profundos con un solo despliegue — antes eran dos perfiles de latencia.
🆚 vs Mistral Large 3
Más barato de self-hostear
Large 3 es un MoE de 675B (41B activos) bajo Apache 2.0 — flagship general más fuerte a $0.5/$1.5, pero mucho más pesado de self-hostear que un denso de 128B.
Tuning agéntico primero
Large 3 gana en amplitud; Medium 3.5 está tuneado para tareas de largo horizonte, tool-calling sincrónico y structured outputs que los agentes consumen.
Trade-off de licencia
El Apache 2.0 de Large 3 es la licencia empresarial más limpia. Si la simplicidad legal pesa más que los scores agénticos para tu workload, Large 3 sigue siendo la elección.
🏢 Dónde queda en el lineup 2026
Mistral Small 4
$0.15/$0.6 · ruteo y chat
Ministral 3 (3B/8B/14B)
$0.1+ · edge y on-device
Magistral
familia de razonamiento transparente
Devstral
reemplazado por 3.5 en Vibe
Voxtral
voz y transcripción
Mistral OCR
extracción de documentos
Regla práctica de upgrade
Si hoy corrés Devstral 2 o Medium 3 en un loop de agentes, probá Medium 3.5 primero — mismo vendor, misma forma de API, delta medible en tasa de éxito. Si usás Large 3 para chat general, no migres: pagarías 3x por token por un tuning agéntico que no vas a usar.
4. Quickstart: llamalo en 5 minutos
Necesitás una API key de La Plateforme desde console.mistral.ai. El ID del modelo es mistral-medium-latest. Abajo está el patrón exacto de los docs de Mistral — instalación, chat completion y el equivalente en curl.
⚙️ Pasos de setup
1. Creá la key
Registrate en console.mistral.ai, generá una API key y exportala como MISTRAL_API_KEY. Nunca la hardcodees.
2. Instalá el SDK
pip install mistralai te da el cliente oficial de Python con chat, agents, batch y structured outputs.
3. Mandá el primer completion
Apuntá model a mistral-medium-latest y mantené los mensajes en el formato chat estándar compatible con OpenAI.
4. Sumá herramientas cuando quieras
Function calling y la Agents API usan el mismo cliente — empezá plano y agregá tools cuando pasen tus evals.
🔌 Dos formas de correrlo
API gestionada
Cero infra. Pagás $1.5/$7.5 por 1M de tokens, con descuentos por batch y caching, corriendo en datacenters de la UE.
Pesos self-hosteados
Bajá los pesos Modified-MIT desde Hugging Face o NVIDIA NIM. Realista desde cuatro GPUs para arriba.
Instalación
pip install mistralai
Python — primera llamada agéntica
import os
from mistralai import Mistral
client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])
res = client.chat.complete(
model="mistral-medium-latest",
messages=[
{"role": "system", "content": "Sos un ingeniero backend senior."},
{"role": "user", "content": "Refactorizá esta función con tipos: def f(d): return [x for x in d if x]"},
],
)
print(res.choices[0].message.content)cURL — la misma llamada, sin SDK
curl https://api.mistral.ai/v1/chat/completions \
-H "Authorization: Bearer $MISTRAL_API_KEY" \
-H "Content-Type: application/json" \
-d ’{"model": "mistral-medium-latest", "messages": [{"role": "user", "content": "Hola desde la terminal"}]}’5. Dónde justifica su precio en producción
Medium 3.5 no es una ganga para chat general — es un caballo de batalla para agentes. Estos son los workloads donde el premium se paga solo.
Coding agents asíncronos
El hábitat natural: los remote agents de Vibe corren sesiones cloud en paralelo — refactors, generación de tests, upgrades de dependencias, triage de CI — y abren un PR para revisión humana.
Work mode de largo horizonte
El Work mode de Le Chat corre research multi-paso y workflows cross-tool (mail, calendario, docs, Jira, Slack) sobre Medium 3.5 con aprobaciones para acciones sensibles.
Pipelines de documentos estructurados
Document QnA más structured outputs lo hacen un buen extractor a JSON antes de tu base de datos — siempre que valides el schema aguas abajo.
Workloads UE con GDPR
La Plateforme corre en datacenters de la UE, lo que simplifica las compras donde rutear prompts por proveedores de EE.UU. es un problema de compliance.
Ruteo por niveles
Usá Small 4 o Ministral para clasificación y borradores, y escalá solo los casos que fallan a Medium 3.5. Medí costo por resultado aceptado, no por token.
6. Límites honestos
Revisé los docs y la página de precios para que no aprendas esto por la vía cara. Nada de esto es dealbreaker — todo afecta tu presupuesto o tu arquitectura.
⚠️ Límites duros
- 1. El precio de output duele a escala: $7.5 por 1M de tokens de salida es 5x Large 3. Los agentes verborrágicos necesitan disciplina de max_tokens y system prompts concisos.
- 2. 256K de contexto ya no es frontera. El retrieval y el chunking siguen importando pasando los ~100K tokens de recall real.
- 3. Asperezas de public preview: pineá versiones y corré tus propios evals antes de promover cualquier checkpoint preview a un path facing clientes.
💸 Costos a vigilar
- Tokens de razonamiento: el esfuerzo configurable es genial, pero el razonamiento profundo quema tokens de output en el tier más caro. Logueá uso por run.
- Matemática de reintentos: un modelo más barato con 2 reintentos puede ganarle a Medium 3.5 en costo por resultado aceptado en tareas fáciles. Bencheá tu propia distribución.
- APIs Enterprise: controles regionales, SLAs y soporte premium corren 75% sobre lista en APIs selectas — modelalo antes de cotizar a clientes.
🧭 Cadencia de revisión
- Mes 1: corré un eval de 200 prompts contra Large 3 y Small 4; quedate con el que gane costo-por-resultado-aceptado por clase de tarea
- Mes 2: revisá los términos Modified MIT y el gating de Hugging Face antes de expandir el footprint self-hosteado
- Mes 3: revisitá el lineup de Mistral — Small 4, Ministral 3 y Magistral se mueven rápido y dejan obsoleta tu tabla de ruteo
7. Veredicto
Medium 3.5 es el primer release de Mistral que defaultearía para loops de agentes en vez de chat: 77.6% SWE-Bench Verified en un denso de 128B que podés self-hostear de verdad, con API hosteada en la UE detrás. El precio de $7.5 de output obliga a desplegarlo con bisturí, no en todos lados.
✅ Usalo cuando
- • Los agentes llaman tools en loops y la tasa de éxito domina el costo
- • Necesitás open weights con fallback de API gestionada
- • La residencia de datos en la UE simplifica tu revisión de compliance
- • Ya corrés agentes con Devstral 2 o Medium 3
- • El self-hosting en ~4 GPUs entra en tu presupuesto de infra
- • Los structured outputs alimentan código aguas abajo
❌ Evitalo cuando
- • El workload es chat plano o resumen a volumen
- • Pipelines output-heavy sin análisis de presupuesto de reintentos
- • Necesitás la simplicidad de licencia Apache 2.0
- • El contexto excede 200K tokens efectivos de rutina
- • Un modelo chico ya pasa tus evals
- • No podés pinear versiones en un ciclo preview
Veredicto
Para trabajo agéntico empresarial, Medium 3.5 es la mejor opción open-weight de Mistral en 2026: probalo en tus 200 prompts agénticos más duros, ruteá todo lo demás al tier inferior, y dejá que el costo por resultado aceptado — no el hype — decida qué queda.
Conclusión
Mistral Medium 3.5 consolida la historia agéntica de Mistral en un modelo open-weight de 128B: 256K de contexto, 77.6% SWE-Bench Verified, $1.5 input / $7.5 output, self-hosteable desde cuatro GPUs. Reemplaza a Devstral 2 en Vibe y se vuelve default de Le Chat por un motivo — confiabilidad de largo horizonte.
Empezá hosteado con mistral-medium-latest esta noche, compará contra Large 3 y Small 4 en tus propios prompts, y recién después decidí qué self-hostear. Todo el playbook empresarial en un párrafo.
Resumen: los tres números
Modelo
- • 128B denso, 256K contexto
- • Open weights Modified MIT
- • mistral-medium-latest
Precio
- • $1.5 in / $7.5 out por 1M
- • Batch −50%, cache hasta −90%
- • APIs Enterprise +75%
Arranque
- • pip install mistralai
- • key en console.mistral.ai
- • Eval de 200 prompts primero
Fuentes
- Mistral AI — Remote agents in Vibe, powered by Medium 3.5 (mayo 2026)
- Mistral Docs — Model card Medium 3.5 (Modified MIT, 256K, $1.5/$7.5)
- Mistral AI — Precios oficiales de la API
- Mistral AI — Presentación de Mistral 3: Large 3 + Ministral 3 (dic 2025)
- Mistral AI — Familia de razonamiento Magistral (AIME 73.6% Medium / 70.7% Small)



