Desarrollo IAEmpresa

Mistral Medium 3.5: el modelo abierto para agentes empresariales

16 de agosto de 2026
9 min de lectura
Guía empresarial del modelo abierto Mistral Medium 3.5
Compartir:

A fines de abril de 2026 Mistral AI lanzó Medium 3.5, un modelo denso de 128B que combina instruction-following, razonamiento y código en un solo set de pesos abiertos. Desde mayo es el modelo por defecto en Le Chat y potencia los agentes remotos de código en Mistral Vibe.

En esta guía desgloso la ficha técnica verificada, qué mejora de verdad frente a Medium 3 y Devstral 2, el precio real de la API y un quickstart de 5 minutos — más los límites honestos que conviene conocer antes de apostar un workload productivo.

1. Qué lanzó Mistral en realidad

Mistral Medium 3.5 es el primer flagship merged de la compañía: un checkpoint denso de 128B con 256K de contexto que resuelve chat, razonamiento y coding agéntico sin cambiar de modelo. Mistral entrenó el vision encoder desde cero para tamaños de imagen variables, y el esfuerzo de razonamiento ahora se configura por request — el mismo modelo responde un chat rápido o trabaja un run largo con muchas herramientas.

Matiz de licencia: Modified MIT ≠ Apache 2.0

Medium 3.5 se publica como open weights bajo licencia Modified MIT, no Apache 2.0 como Large 3. Para la mayoría de los builds sigue siendo permisiva, pero a los abogados de empresa les importa la diferencia: leé los términos exactos del model card antes de asumir condiciones de self-hosting idénticas a Large 3.

Por qué importa para equipos enterprise: tenés un vendor europeo con datacenters en la UE, pesos abiertos que podés self-hostear desde cuatro GPUs, y una API gestionada bajo el ID mistral-medium-latest. Ese trío — historia de soberanía, opción de salida y API gestionada — es justo lo que piden las checklists de compras.

2. Ficha técnica

Todo lo de abajo sale del model card oficial y la página de precios de Mistral, no de rumores de terceros. Es la ficha que podés pegar en un architecture decision record.

🧠

Parámetros

denso · 128B

Un solo modelo denso de 128B que fusiona instruction-following, razonamiento y código. Sin ruteo MoE que tunear ni checkpoint de razonamiento separado.

📏

Contexto

256K tokens

Ventana de 256K con structured outputs, function calling, document QnA y soporte de la API de Agents & Conversations.

📜

Licencia

Modified MIT · open weights

Pesos abiertos en Hugging Face bajo licencia Modified MIT. También servido en NVIDIA NIM y build.nvidia.com para prototipar.

💰

Precio API

La Plateforme · por 1M tokens

$1.5 input / $7.5 output por millón de tokens vía el ID mistral-medium-latest. Batch descuenta 50%, inputs cacheados hasta 90%.

🖥️

Self-host

4+ GPUs

Mistral reporta self-hosting desde apenas cuatro GPUs. Compará con el footprint MoE de 675B de Large 3 antes de dimensionar hardware.

🏁

Benchmarks

blog oficial · mayo 2026

77.6% en SWE-Bench Verified — por encima de Devstral 2 y Qwen3.5 397B A17B según Mistral — más 91.4 en τ³-Telecom para llamadas agénticas.

La cuenta empresarial

A $1.5/$7.5 cuesta 3x la tarifa $0.5/$1.5 de Large 3 — pagás el premium por confiabilidad agéntica, no por chat crudo. Ruteá clasificación y extracción a Small 4 ($0.15/$0.6) o Ministral 3B ($0.1/$0.1) y reservá Medium 3.5 para runs multi-herramienta donde los reintentos son el costo real.

3. Qué mejora frente a la generación anterior

Medium 3.5 no reemplaza todo el lineup — ocupa el slot agéntico tope de gama. Así se mapea contra lo que vino antes.

🆚 vs Medium 3 y Devstral 2

Un modelo en vez de dos

Medium 3 cubría chat general mientras Devstral 2 era dueño de los coding agents. Medium 3.5 fusiona ambos y reemplaza a Devstral 2 dentro del CLI de Vibe.

SWE-Bench Verified: 77.6%

El número titular de Mistral supera a Devstral 2 sin discusión. Si tu cuello de botella es la tasa de éxito del agente en repos reales, este es el upgrade que mueve la métrica.

Esfuerzo de razonamiento configurable

El control de razonamiento por request permite servir chat rápido y runs agénticos profundos con un solo despliegue — antes eran dos perfiles de latencia.

🆚 vs Mistral Large 3

Más barato de self-hostear

Large 3 es un MoE de 675B (41B activos) bajo Apache 2.0 — flagship general más fuerte a $0.5/$1.5, pero mucho más pesado de self-hostear que un denso de 128B.

Tuning agéntico primero

Large 3 gana en amplitud; Medium 3.5 está tuneado para tareas de largo horizonte, tool-calling sincrónico y structured outputs que los agentes consumen.

Trade-off de licencia

El Apache 2.0 de Large 3 es la licencia empresarial más limpia. Si la simplicidad legal pesa más que los scores agénticos para tu workload, Large 3 sigue siendo la elección.

🏢 Dónde queda en el lineup 2026

Mistral Small 4

$0.15/$0.6 · ruteo y chat

Ministral 3 (3B/8B/14B)

$0.1+ · edge y on-device

Magistral

familia de razonamiento transparente

Devstral

reemplazado por 3.5 en Vibe

Voxtral

voz y transcripción

Mistral OCR

extracción de documentos

Regla práctica de upgrade

Si hoy corrés Devstral 2 o Medium 3 en un loop de agentes, probá Medium 3.5 primero — mismo vendor, misma forma de API, delta medible en tasa de éxito. Si usás Large 3 para chat general, no migres: pagarías 3x por token por un tuning agéntico que no vas a usar.

4. Quickstart: llamalo en 5 minutos

Necesitás una API key de La Plateforme desde console.mistral.ai. El ID del modelo es mistral-medium-latest. Abajo está el patrón exacto de los docs de Mistral — instalación, chat completion y el equivalente en curl.

⚙️ Pasos de setup

1. Creá la key

Registrate en console.mistral.ai, generá una API key y exportala como MISTRAL_API_KEY. Nunca la hardcodees.

2. Instalá el SDK

pip install mistralai te da el cliente oficial de Python con chat, agents, batch y structured outputs.

3. Mandá el primer completion

Apuntá model a mistral-medium-latest y mantené los mensajes en el formato chat estándar compatible con OpenAI.

4. Sumá herramientas cuando quieras

Function calling y la Agents API usan el mismo cliente — empezá plano y agregá tools cuando pasen tus evals.

🔌 Dos formas de correrlo

API gestionada

Cero infra. Pagás $1.5/$7.5 por 1M de tokens, con descuentos por batch y caching, corriendo en datacenters de la UE.

Pesos self-hosteados

Bajá los pesos Modified-MIT desde Hugging Face o NVIDIA NIM. Realista desde cuatro GPUs para arriba.

Instalación

pip install mistralai

Python — primera llamada agéntica

import os
from mistralai import Mistral

client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

res = client.chat.complete(
    model="mistral-medium-latest",
    messages=[
        {"role": "system", "content": "Sos un ingeniero backend senior."},
        {"role": "user", "content": "Refactorizá esta función con tipos: def f(d): return [x for x in d if x]"},
    ],
)
print(res.choices[0].message.content)

cURL — la misma llamada, sin SDK

curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d ’{"model": "mistral-medium-latest", "messages": [{"role": "user", "content": "Hola desde la terminal"}]}’

5. Dónde justifica su precio en producción

Medium 3.5 no es una ganga para chat general — es un caballo de batalla para agentes. Estos son los workloads donde el premium se paga solo.

🤖

Coding agents asíncronos

El hábitat natural: los remote agents de Vibe corren sesiones cloud en paralelo — refactors, generación de tests, upgrades de dependencias, triage de CI — y abren un PR para revisión humana.

📋

Work mode de largo horizonte

El Work mode de Le Chat corre research multi-paso y workflows cross-tool (mail, calendario, docs, Jira, Slack) sobre Medium 3.5 con aprobaciones para acciones sensibles.

📄

Pipelines de documentos estructurados

Document QnA más structured outputs lo hacen un buen extractor a JSON antes de tu base de datos — siempre que valides el schema aguas abajo.

🇪🇺

Workloads UE con GDPR

La Plateforme corre en datacenters de la UE, lo que simplifica las compras donde rutear prompts por proveedores de EE.UU. es un problema de compliance.

🪜

Ruteo por niveles

Usá Small 4 o Ministral para clasificación y borradores, y escalá solo los casos que fallan a Medium 3.5. Medí costo por resultado aceptado, no por token.

6. Límites honestos

Revisé los docs y la página de precios para que no aprendas esto por la vía cara. Nada de esto es dealbreaker — todo afecta tu presupuesto o tu arquitectura.

⚠️ Límites duros

  1. 1. El precio de output duele a escala: $7.5 por 1M de tokens de salida es 5x Large 3. Los agentes verborrágicos necesitan disciplina de max_tokens y system prompts concisos.
  2. 2. 256K de contexto ya no es frontera. El retrieval y el chunking siguen importando pasando los ~100K tokens de recall real.
  3. 3. Asperezas de public preview: pineá versiones y corré tus propios evals antes de promover cualquier checkpoint preview a un path facing clientes.

💸 Costos a vigilar

  1. Tokens de razonamiento: el esfuerzo configurable es genial, pero el razonamiento profundo quema tokens de output en el tier más caro. Logueá uso por run.
  2. Matemática de reintentos: un modelo más barato con 2 reintentos puede ganarle a Medium 3.5 en costo por resultado aceptado en tareas fáciles. Bencheá tu propia distribución.
  3. APIs Enterprise: controles regionales, SLAs y soporte premium corren 75% sobre lista en APIs selectas — modelalo antes de cotizar a clientes.

🧭 Cadencia de revisión

  1. Mes 1: corré un eval de 200 prompts contra Large 3 y Small 4; quedate con el que gane costo-por-resultado-aceptado por clase de tarea
  2. Mes 2: revisá los términos Modified MIT y el gating de Hugging Face antes de expandir el footprint self-hosteado
  3. Mes 3: revisitá el lineup de Mistral — Small 4, Ministral 3 y Magistral se mueven rápido y dejan obsoleta tu tabla de ruteo

7. Veredicto

Medium 3.5 es el primer release de Mistral que defaultearía para loops de agentes en vez de chat: 77.6% SWE-Bench Verified en un denso de 128B que podés self-hostear de verdad, con API hosteada en la UE detrás. El precio de $7.5 de output obliga a desplegarlo con bisturí, no en todos lados.

✅ Usalo cuando

  • Los agentes llaman tools en loops y la tasa de éxito domina el costo
  • Necesitás open weights con fallback de API gestionada
  • La residencia de datos en la UE simplifica tu revisión de compliance
  • Ya corrés agentes con Devstral 2 o Medium 3
  • El self-hosting en ~4 GPUs entra en tu presupuesto de infra
  • Los structured outputs alimentan código aguas abajo

❌ Evitalo cuando

  • El workload es chat plano o resumen a volumen
  • Pipelines output-heavy sin análisis de presupuesto de reintentos
  • Necesitás la simplicidad de licencia Apache 2.0
  • El contexto excede 200K tokens efectivos de rutina
  • Un modelo chico ya pasa tus evals
  • No podés pinear versiones en un ciclo preview

Veredicto

Para trabajo agéntico empresarial, Medium 3.5 es la mejor opción open-weight de Mistral en 2026: probalo en tus 200 prompts agénticos más duros, ruteá todo lo demás al tier inferior, y dejá que el costo por resultado aceptado — no el hype — decida qué queda.

Conclusión

Mistral Medium 3.5 consolida la historia agéntica de Mistral en un modelo open-weight de 128B: 256K de contexto, 77.6% SWE-Bench Verified, $1.5 input / $7.5 output, self-hosteable desde cuatro GPUs. Reemplaza a Devstral 2 en Vibe y se vuelve default de Le Chat por un motivo — confiabilidad de largo horizonte.

Empezá hosteado con mistral-medium-latest esta noche, compará contra Large 3 y Small 4 en tus propios prompts, y recién después decidí qué self-hostear. Todo el playbook empresarial en un párrafo.

Resumen: los tres números

Modelo

  • • 128B denso, 256K contexto
  • • Open weights Modified MIT
  • • mistral-medium-latest

Precio

  • • $1.5 in / $7.5 out por 1M
  • • Batch −50%, cache hasta −90%
  • • APIs Enterprise +75%

Arranque

  • • pip install mistralai
  • • key en console.mistral.ai
  • • Eval de 200 prompts primero
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego