Desarrollo IAOpen Source

GPT-OSS: El Modelo Abierto de OpenAI y Cómo Desplegarlo

4 de agosto de 2026
10 min de lectura
Guía de despliegue de los modelos open-weight GPT-OSS
Compartir:

OpenAI liberó gpt-oss-120b y gpt-oss-20b, sus primeros modelos de lenguaje open-weight desde GPT-2, bajo la permisiva licencia Apache 2.0.

En esta guía desgloso las specs verificadas de ambos tamaños, qué cambia este lanzamiento para desarrolladores y cómo correr el modelo 20b en tu propia máquina esta semana.

1. Contexto: Qué Liberó Realmente OpenAI

OpenAI anunció la familia gpt-oss el 5 de agosto de 2025, después de anticipar el trabajo con la comunidad open-source. Son modelos de razonamiento solo-texto construidos como Transformers Mixture-of-Experts, entrenados con técnicas de reinforcement learning informadas por los sistemas internos más avanzados de OpenAI, incluyendo o3. Ambos tamaños vienen cuantizados de forma nativa en MXFP4, que es exactamente lo que hace práctico su consumo de memoria.

gpt-oss-120b — el grande

117B parámetros totales con 5.1B activos por token, 36 capas, 128 expertos con ruteo top-4. Entra en una sola GPU de 80GB para razonamiento de nivel producción.

gpt-oss-20b — el local

21B parámetros totales con 3.6B activos por token, 24 capas, 32 expertos con ruteo top-4. Corre con 16GB de memoria en hardware de consumo.

Ventana de contexto

128k tokens de forma nativa, con rotary position embeddings y grouped multi-query attention para inferencia eficiente en contextos largos.

Licencia

Apache 2.0 más una política de uso — el uso comercial, la modificación y el fine-tuning están permitidos sin obligaciones de copyleft.

Control de razonamiento

Esfuerzo de razonamiento configurable (low, medium, high) más acceso completo al chain-of-thought, para poder depurar lo que el modelo estaba pensando.

Por Qué Importa Apache 2.0

A diferencia de las licencias restrictivas de investigación, Apache 2.0 te permite usar, modificar y distribuir estos pesos dentro de productos comerciales sin obligaciones de copyleft ni riesgo de patentes. Esa es la diferencia entre una demo que podés admirar y una infraestructura sobre la que podés construir.

En benchmarks, OpenAI reporta que gpt-oss-120b alcanza casi la paridad con o4-mini en evaluaciones centrales de razonamiento y supera a o3-mini, mientras que gpt-oss-20b iguala o supera a o3-mini a pesar de su tamaño — con buenos resultados en matemática de competencia, uso de herramientas y consultas de salud. Tomá los números del vendor como una señal inicial, no como evangelio: la prueba real es tu propio workload, que ahora podés correr gratis.

2. Cuatro Implicaciones para Desarrolladores

Un modelo de razonamiento open-weight de esta clase cambia tanto la economía como la arquitectura de lo que podés distribuir. Estos son los cuatro cambios que considero más importantes.

🔬

Prototipá en local, desplegá donde quieras

El modelo 20b corre con 16GB de memoria, así que una GPU de consumo decente o una laptop potente pueden hospedar un modelo de razonamiento offline. Los ciclos de iteración bajan de minutos a segundos, y tus demos funcionan en el avión.

💰

Experimentar sale dramáticamente más barato

Cada prompt fallido, cada barrido de evals y cada experimento de fine-tuning antes quemaba créditos de API. Con los pesos en tu propio disco, el costo marginal de una corrida más es básicamente electricidad.

🛠️

Bloques agénticos incluidos

Function calling nativo, uso de herramientas web-search y Python, structured outputs y acceso completo al chain-of-thought hacen que estos modelos estén listos para scaffolding de agentes sin depender de APIs propietarias.

🧬

Libertad de fine-tuning

Apache 2.0 más pesos liberados significa que podés especializar el modelo 20b en tu dominio y distribuirlo dentro de tu producto. El 120b incluso puede ajustarse en un solo nodo H100.

No Te Saltees la Letra Chica

Son modelos solo-texto sin entrada de visión, y todas las evals oficiales se corrieron sobre los checkpoints cuantizados en MXFP4 — los artefactos exactos que descargás. Los modelos de razonamiento además gastan tokens pensando, así que presupuestá los tokens de salida y empezá con esfuerzo bajo para tareas simples.

3. Qué Hacer Esta Semana: Correrlo en Local

La forma más rápida de entender estos modelos es correr uno. Empezá con el tamaño 20b — es la opción para hardware de consumo — y escalá solo si tu tarea lo exige.

Día 1–2: Conversá con él vía Ollama

Instalá Ollama, descargá los pesos (unos 14GB en disco) y empezá a chatear offline. Es el setup más simple posible y necesita al menos 16GB de VRAM o memoria unificada.

ollama pull gpt-oss:20b
ollama run gpt-oss:20b

Día 3–4: Servilo como API con vLLM

Para uso estilo servidor, vLLM expone un endpoint compatible con OpenAI en localhost:8000 al que tu código existente puede apuntar. Usá el build de gpt-oss fijado por la guía oficial.

uv pip install --pre vllm==0.10.1+gptoss --extra-index-url https://wheels.vllm.ai/gpt-oss/ --extra-index-url https://download.pytorch.org/whl/nightly/cu128 --index-strategy unsafe-best-match

vllm serve openai/gpt-oss-20b

Día 5: Bajá los pesos crudos de Hugging Face

Si querés la implementación de referencia o planeás hacer fine-tuning, descargá los checkpoints directamente de la colección oficial de openai en el Hub.

huggingface-cli download openai/gpt-oss-20b --include "original/*" --local-dir gpt-oss-20b/

Fin de semana: Ponelo a trabajar en una tarea real

Apuntá un scaffold de agentes a tu endpoint local, probá el esfuerzo de razonamiento low, medium y high sobre el mismo prompt, y compará costo, latencia y calidad contra el modelo de API que usás hoy. Una tarea medida vale más que diez threads de opinión.

Regla de Oro de Hardware

El modelo 20b necesita al menos 16GB de VRAM o memoria unificada, y los contextos largos en una placa de 16GB quedan justos — limitá la longitud de contexto si chocás con errores de memoria. El 120b pide unos 60GB o más, así que tratalo como territorio de workstation o servidor.

4. Límites Honestos Antes de Comprometerte

Los pesos abiertos no significan magia. Esto es lo que yo verificaría antes de apostar un sistema de producción a gpt-oss.

📝

Solo texto, sin visión

Si tu pipeline necesita entrada de imágenes, igual vas a necesitar un modelo multimodal junto a gpt-oss. Planeá una arquitectura de dos modelos desde el inicio en lugar de descubrirlo a mitad del proyecto.

🖥️

La vara del 120b es real

Entrar en 80GB significa una GPU de datacenter o una workstation multi-GPU seria. La mayoría de los desarrolladores independientes deberían prototipar en 20b y rentar inferencia del 120b por hora.

🗜️

MXFP4 es el único sabor oficial

Los pesos vienen cuantizados de forma nativa a MXFP4 sin otra cuantización oficial, y los ports de la comunidad varían en calidad. Quedate con los artefactos oficiales de Ollama, vLLM o Hugging Face.

🧪

Los benchmarks del vendor son una señal inicial

Casi o4-mini e igualando a o3-mini son los números de OpenAI en las evals de OpenAI. Re-corré las evaluaciones que importan para tu dominio antes de prometerle nada a un cliente.

Regla de Oro

Open-weight no es training data open-source: recibís los pesos, no el dataset ni la receta completa de entrenamiento. Auditá las salidas, guardá evals y nunca distribuyas un modelo que no testeaste en tu propia distribución.

Conclusión

El lanzamiento de gpt-oss mueve un modelo de razonamiento serio desde detrás de una API key hacia dentro de tu propia infraestructura. Eso cambia quién puede experimentar, qué latencia es aceptable y cuánto control conservás sobre tu stack.

Mi recomendación es simple: dedicate una semana al modelo 20b en tu propia máquina, medilo en una tarea real, y después decidí si el 120b — o tu proveedor de API actual — se gana un lugar en tu arquitectura.

GPT-OSS: Cheat Sheet

Los Modelos

  • • 120b: 117B totales, 5.1B activos, GPU 80GB
  • • 20b: 21B totales, 3.6B activos, 16GB
  • • 128k contexto · Apache 2.0

Correrlo

  • • ollama run gpt-oss:20b
  • • vllm serve openai/gpt-oss-20b
  • • HF: openai/gpt-oss-20b

Construir

  • • Tool use + structured outputs
  • • CoT completo para debug
  • • Pesos ajustables (fine-tune)

Fuentes

Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego