El 16 de julio de 2026, Moonshot AI lanzó Kimi K3 — un Mixture-of-Experts de 2.8 billones de parámetros con ventana de 1M de tokens y visión nativa. Once días después, el 27 de julio, los pesos abiertos completos llegaron a Hugging Face, convirtiéndolo en el modelo abierto más grande jamás publicado.
En esta guía te doy la ficha técnica exacta, qué mejora K3 frente a K2.6 y K2.7 Code, sus puntajes de laboratorio y de terceros con etiquetas honestas, un quickstart verificado contra la API oficial y los límites que conviene conocer antes de construir sobre él.
1. Kimi K3 de un vistazo: la ficha técnica
Kimi K3 es el modelo más capaz de Moonshot AI hasta la fecha y, por cantidad de parámetros, el primer modelo abierto de clase 3T del mundo. Cada cifra de abajo viene de la model card oficial, del repo Kimi-K3 en GitHub y de los docs de plataforma enlazados en Fuentes — ningún número de la era K2 reciclado como actual.
Parámetros
2.8T totales MoE · 896 expertos, 16 activos por token (104B activos)
Contexto
1M tokens (1.048.576) · texto + imagen + video de entrada
Arquitectura
Kimi Delta Attention + Attention Residuals + Stable LatentMoE
Licencia
Kimi K3 License (MIT modificada) — pesos abiertos, uso comercial permitido
Precio API
$3 / 1M input · $0.30 cache hits · $15 / 1M output — modelo kimi-k3
Dónde vive
Hugging Face moonshotai/Kimi-K3 + API compatible con OpenAI
Por qué el thinking siempre activo importa en tu factura
K3 razona en cada request, y los tokens de razonamiento se facturan como output a $15 por millón. Presupuestá output con generosidad — un run agéntico profundo puede generar muchísimos más tokens de salida que una respuesta de chat.
Timeline en una línea: lanzamiento de la API de Kimi K3 el 16 de julio de 2026 → pesos completos en Hugging Face el 27 de julio de 2026 → el modelo que cubre esta guía. Sus antecesores fueron K2.6 (abril 2026) y K2.7 Code (junio 2026) — la próxima sección arma la comparación sobre esos dos.
2. Qué mejora vs K2.6 y K2.7 Code
Una generación atrás, K2.6 traía 1T de parámetros totales (32B activos) y ventana de 256K; K2.7 Code (junio 2026) especializó esa línea para agentes de programación. K3 salta a 2.8T totales con 104B activos por token y 1M de contexto completo — unas 4x la ventana. Estos son los números principales, etiquetados tal cual son:
DeepSWE 1.0
Reportado por el lab. Ingeniería de software de largo horizonte — comparalo con reruns independientes antes de citarlo como hecho.
GPQA Diamond
Reportado por el lab. QA científico de nivel posgrado — fuerte, pero first-party hasta que se reproduzca.
Frontend Code Arena
De terceros (LMArena). #1 global, por encima de Claude Fable 5 — preferencia humana ciega en código front-end.
Intelligence Index
Agregado de terceros (Artificial Analysis). Empatado con GLM-5.3 en lo alto del tablero open-weights.
Ventana de contexto
4x los 256K de K2.6. Iguala las ventanas 1M de los flagships cerrados — la vieja ventaja de contexto largo hoy es empate.
Control de razonamiento
Thinking siempre activo con flag reasoning_effort (default max). Al lanzar solo existía max; low y high llegaron en días.
El número que me convenció
1679 en la Frontend Code Arena — #1 global, no solo #1 entre abiertos, y 17 puestos por encima de K2.6. Las tablas de vendors son marketing; los votos humanos ciegos sobre UI shipeada son lo más parecido a un examen real que tiene esta industria.
Enmarcado en su propia familia: K2.6 (abril 2026, 1T/32B, 256K, MIT modificada) hizo de Moonshot el líder de precios open-weights; K2.7 Code (junio 2026) apuntó la línea a agentes de programación. K3 mantiene los pesos abiertos pero sube de gama — unas 3x el precio de input de la familia K2 — cambiando la etiqueta de descuento por puntajes frontier.
3. Quickstart: API compatible con OpenAI en minutos
La API de Kimi habla el protocolo chat-completions de OpenAI, así que cualquier SDK de OpenAI sirve — solo cambiás la base URL y la key. Cada línea de abajo está tomada de los docs oficiales de plataforma, incluyendo el endpoint global verificado.
Opción A — Python con el SDK de OpenAI
Instalá openai>=1.0, exportá MOONSHOT_API_KEY desde la consola de Kimi y corré la llamada mínima directo de los docs:
pip install --upgrade "openai>=1.0"
export MOONSHOT_API_KEY="your-kimi-key"
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Introduce Kimi K3 in one sentence."}],
)
print(completion.choices[0].message.content)Opción B — La misma llamada con cURL
Sin SDK. Mismo model id y endpoint, HTTP plano:
curl https://api.moonshot.ai/v1/chat/completions \
--header "Authorization: Bearer $MOONSHOT_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Introduce Kimi K3 in one sentence."}]
}'Opción C — Ajustá esfuerzo de razonamiento y caché
K3 siempre piensa — controlá el costo con reasoning_effort y dejá que el caché automático de contexto descuente el input repetido a $0.30 por millón:
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Refactor this module."}],
reasoning_effort="low", # "low" | "high" | "max" (default)
)
# Los prefijos largos repetidos usan caché automático de contexto:
# el input con cache-hit se factura a $0.30 / 1M en vez de $3.00 / 1M.Detalle del endpoint que conviene saber
Algunas guías de terceros citan https://api.kimi.ai/v1 — los docs oficiales de plataforma usan https://api.moonshot.ai/v1 para el protocolo compatible con OpenAI (y https://api.moonshot.ai/anthropic para el de Anthropic). Apuntá tu cliente al host documentado o la autenticación va a fallar.
Eso es todo el setup: una key, una base URL, modelo kimi-k3. Si ya llamás a OpenAI, migrar es literalmente reemplazar base_url y api_key — los docs incluso traen una página de migración dedicada.
4. Límites honestos
K3 es el release open-weights más fuerte de 2026, pero “el abierto más fuerte” no es “sin trade-offs”. Acá está donde te cuesta — en dinero, hardware o confianza.
No lo vas a self-hostear en una workstation
Los pesos rondan 1.5 TB en MXFP4 nativo en 96 shards safetensors. Servirlo en serio exige clusters GPU multi-nodo con vLLM o SGLang — para casi todos, la API hosteada es el camino sensato.
La mitad de los números famosos son first-party
DeepSWE 67.5 y GPQA 93.5 son runs del lab de Moonshot. El 1679 de Arena es independiente y fuerte, pero re-corré los dos benchmarks que matchean tu workload antes de migrar un equipo.
Puntajes frontier, precios frontier
A $3/$15 por millón de tokens, K3 cuesta unas 3x la familia K2 en input y se ubica cerca de las tarifas tier Sonnet de Claude. El descuento de $0.30 por cache-hit solo ayuda si reutilizás prefijos largos.
El thinking siempre activo grava el output
No existe variante K3 barata sin thinking. Los tokens de razonamiento se facturan como output, así que los loops agénticos profundos se encarecen rápido — poné reasoning_effort en low para borradores.
La licencia es custom, no MIT plano
La Kimi K3 License deriva de MIT y permite uso comercial, pero lecturas de la comunidad marcan condiciones extra para grandes operadores de Model-as-a-Service. Leé el archivo LICENSE en Hugging Face antes de shipear un producto sobre él.
El error más común
Citar specs de K2.6 como specs de K3. K2.6 era 1T/32B con 256K de contexto a $0.95/$4 — K3 es 2.8T/104B con 1M de contexto a $3/$15. Mezclar las dos generaciones subestima el modelo y la factura por ~3x.
Ninguno es dealbreaker — son el precio normal de los pesos abiertos frontier. El release abierto (pesos más reporte técnico más kernels de serving) permite que la comunidad verifique las afirmaciones en vez de tomarlas por fe, que es exactamente lo que te recomiendo hacer en tu propio workload.
Veredicto
Si querés inteligencia casi-frontier con pesos descargables, Kimi K3 es la respuesta abierta por defecto de fines de 2026: un MoE de 2.8T con 1M de contexto, visión nativa, thinking siempre activo, un #1 en Arena en código front-end y un quickstart de cinco minutos compatible con OpenAI.
Mi recomendación: prototipá contra la API hosteada con reasoning_effort en low y prompts amigables al caché durante dos semanas, mantené tu modelo actual como baseline y compará tareas completadas — no screenshots de benchmarks. El self-hosting puede esperar hasta que tu volumen justifique un cluster.
En una línea
Usalo para
- • Coding agéntico + generación front-end
- • Knowledge work de contexto 1M
- • Pesos abiertos con fallback a API
Evitá para
- • Self-hosting en workstation
- • Workloads de mínimo costo por token
- • Producción day-one sin evals
Recordá
- • El endpoint es api.moonshot.ai
- • Los cache hits cuestan $0.30
- • Etiquetá lab vs scores independientes



