DeepSeek se saltó el rumoreado R2 y lanzó lo que realmente importa: DeepSeek V4, una familia open-weight de dos niveles con ventana de 1M de tokens. Revisé la documentación, la página de precios y la API para que no tengas que adivinar.
En esta guía tenés la ficha técnica, qué mejora V4 frente a V3.2, benchmarks reportados por DeepSeek con sus matices honestos, precios oficiales y un quickstart verificado que corrés en cinco minutos.
1. Ficha Técnica: V4 Pro vs V4 Flash
DeepSeek V4 Preview salió el 24 de abril de 2026 con dos modelos Mixture-of-Experts. Ambos son open-weight bajo licencia MIT, ambos soportan 1M de contexto con hasta 384K tokens de salida, y ambos exponen modos Thinking y Non-Thinking en la misma API.
V4 Pro — el insignia
1.6T totales · 49B activos · build GA 0813
Insignia MoE para razonamiento duro y coding agentico. Servido como DeepSeek-V4-Pro-0813 (GA desde el 13 de agosto de 2026). Pesos en HuggingFace bajo MIT.
V4 Flash — el eficiente
284B totales · 13B activos · build 0731
MoE rápido y económico para alto volumen. Servido como DeepSeek-V4-Flash-0731 (beta pública desde el 31 de julio de 2026). Mismo contexto 1M y misma API que Pro.
Flash Vision Exp — experimental
Acepta imágenes · experimental
Variante multimodal experimental (deepseek-v4-flash-vision-exp, 21 de agosto de 2026) que además acepta imágenes. Esperá bordes filosos.
Licencia y pesos
MIT · HuggingFace
Ambos niveles publican pesos abiertos bajo licencia MIT (colección deepseek-ai/deepseek-v4). Podés self-hostear, fine-tunear y destilar sin costo por token.
Precios oficiales de la API (por 1M de tokens)
En horario pico, el input sin caché cuesta $0.44 (Flash) y $1.32 (Pro); la salida cuesta $1.32 (Flash) y $3.96 (Pro). Fuera de pico las tarifas son exactamente la mitad. El input con caché baja a $0.014 (Flash) y $0.044 (Pro) en pico. El pico es 01:00–04:00 y 06:00–10:00 UTC, lunes a viernes. Revisá siempre la página oficial antes de presupuestar — las cifras promo anteriores ($0.14/$0.28 Flash, $0.435/$0.87 Pro) ya no reflejan la tabla actual.
Contexto y superficie de API
URL base https://api.deepseek.com (formato OpenAI) más un endpoint compatible con Anthropic. Ambos modelos soportan JSON, tool calls, Responses API, chat prefix completion y FIM (solo modo non-thinking). Los nombres viejos deepseek-chat y deepseek-reasoner se retiraron el 24 de julio de 2026.
2. Qué Mejora V4 Frente a V3.2
V4 es tanto un release de eficiencia como de capacidad. El cambio grande es una atención híbrida que combina Compressed Sparse Attention (CSA) y Heavily Compressed Attention (HCA), más Hyper-Connections con restricción de manifold y el optimizador Muon del reporte técnico de abril.
🧠 Contexto de un millón de tokens que sí se puede pagar
Con 1M de contexto, V4 Pro necesita solo ~27% de los FLOPs por token y 10% del KV cache de V3.2. Flash va más lejos: ~10% de los FLOPs y 7% del cache. Agentes de horizonte largo y análisis de repos enteros se vuelven económicamente viables.
💻 Código casi fronterizo, open-weight
Según DeepSeek, V4-Pro-Max llega a 80.6% en SWE-bench Verified, 93.5 en LiveCodeBench, 87.5 en MMLU-Pro y 90.1 en GPQA Diamond. Flash-Max lo sigue de cerca con 79.0% en SWE-bench Verified — una brecha de 1.6 puntos que rara vez se nota en tareas rutinarias.
🔌 API moderna: Responses + compatible Anthropic
V4 soporta nativamente la Responses API y un endpoint compatible con Anthropic, con modos duales Thinking/Non-Thinking en un solo model ID. Chau malabares entre endpoints de chat vs reasoner.
Una nota sobre R2
Quizás viste rumores del “DeepSeek R2”. Verificado en agosto de 2026, no existe release oficial de R2: ni model card, ni API ID, ni precios, ni página en HuggingFace — la línea oficial es V4 Pro y V4 Flash. Cubro V4 porque es lo que hoy sí podés llamar.
3. Quickstart: Llamá a V4 en Cinco Minutos
La API es compatible con OpenAI, así que conservás tu tooling y solo cambiás la base URL y el nombre del modelo. Conseguí una key en la plataforma de DeepSeek y corré uno de estos snippets verificados.
cURL — primer chat completion
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Eres un asistente útil."},
{"role": "user", "content": "Explicá el ruteo MoE en dos frases."}
]
}'Python — SDK de OpenAI con thinking mode
from openai import OpenAI
client = OpenAI(
api_key="tu-key-aqui",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Eres un asistente senior de código."},
{"role": "user", "content": "Escribí un decorador de reintentos con backoff exponencial."},
],
extra_body={"reasoning_effort": "high"},
)
print(response.choices[0].message.content)Mi regla de ruteo
Flash por defecto para chat, clasificación, extracción y ayuda de código estándar — conserva ~80–85% de la calidad de Pro a una fracción del precio. Pasá a Pro para loops de coding agentico, razonamiento duro y workflows de 20+ pasos donde la confiabilidad paga el premium. Programá los batch fuera de pico para pagar la mitad.
4. Límites Honestos
V4 es hoy el mejor valor en pesos abiertos, pero no es magia. Estos son los límites que planificaría antes de llevarlo a producción.
- • Los benchmarks son reportados por DeepSeek en su propio harness — la reproducción independiente de los builds 0813/0731 sigue pendiente, así que verificá en tus tareas.
- • Sigue el matiz “preview”: las capacidades pueden expandirse y el comportamiento cambia entre builds (Flash-0731 vs Pro-0813 son distintos post-trains).
- • El pico cuesta 2x el fuera de pico y Pro cuesta ~3x Flash a igual uso — un default de siempre-Pro quema presupuesto rápido.
- • Los términos de la API hosteada permiten entrenar con tus inputs — pasá datos propietarios por un proveedor de inferencia en USA o self-hosteá bajo MIT.
- • Sensibilidad conocida en temas políticos de China; sin system card publicada ni red-teaming formal hasta mediados de 2026.
- • Solo salida de texto y tool-calls — sin generación de audio ni video, y visión aún experimental solo en Flash.
Regla de oro
Medí la brecha de 1.6 puntos de SWE-bench en tu propio repo antes de decidir. Si Flash pasa tu CI al mismo ritmo que Pro, acabás de recortar la factura a un tercio — guardá la diferencia y escalá solo los casos duros.
5. Veredicto
Para la mayoría de los equipos en 2026, DeepSeek V4 Flash es el default y V4 Pro es la vía de escalamiento. Flash cubre la mayoría de alto volumen tras el post-train 0731, mientras Pro justifica su premium en coding agentico, programación competitiva y razonamiento de horizonte largo.
Esa combinación — 1M de contexto, pesos MIT, código clase 80.6% SWE-bench a precios de modelo abierto — pone a V4 en cada shortlist que armo. Respetá las etiquetas preview, verificá en tu workload y mirá el reloj de pico/fuera de pico.
Quién debería elegir qué
Elegí Flash si: corrés chat, review, refactor o extracción de alto volumen donde mandan latencia y costo.
Elegí Pro si: el coding agentico es tu cuello de botella, necesitás esfuerzo máximo de razonamiento, o el análisis long-context define ingresos.
Fuentes
Cada nombre de versión, spec y precio de arriba viene de la documentación propia de DeepSeek — nunca de threads de rumores. Las cifras de benchmarks son reportadas por DeepSeek y marcadas como tales hasta que lleguen reproducciones independientes.
Si te sirvió, mirá las dos guías de modelos abiertos relacionadas — usan el mismo patrón de quickstart para comparar Qwen, GPT-OSS y DeepSeek en igualdad de condiciones.
Fuentes y lectura adicional
- Docs de la API de DeepSeek — primera llamada (model IDs deepseek-v4-flash / pro)
- Docs de la API de DeepSeek — modelos y precios (tabla oficial)
- Docs de la API de DeepSeek — change log (beta Flash 0731, GA Pro 0813)
- Notas del release DeepSeek V4 Preview (24 de abril de 2026)
- Reporte técnico DeepSeek-V4 (arXiv 2606.19348)
- Pesos abiertos — colección deepseek-ai/deepseek-v4 en HuggingFace



