Desarrollo IAProgramación

GLM-5.3 en 2026: benchmarks, precios y guía de setup

3 de septiembre de 2026
10 min de lectura
GLM-5.3 en 2026 benchmarks, precios y guía de setup
Compartir:

Si programás con IA en 2026, el nombre que tenés que conocer es GLM-5.3 de Zhipu (Z.ai). Lanzado el 14 de agosto de 2026 sobre el mismo base model que GLM-5.2 — cada punto ganado sale solo del post-training — hoy es el flagship open-weights de programación: SOTA abierto en Terminal-Bench 3.0 y Agents’ Last Exam, 84.5% en CyberGym y pesos abiertos en Hugging Face desde fines de agosto.

En esta guía te muestro la ficha exacta de GLM-5.3, sus números públicos contra GLM-5.2 y la frontera cerrada (todo reportado por Z.ai, fuentes al final), qué cambió desde GLM-5.2 y cómo correrlo hoy en Claude Code, Cline o con la API directa.

1. GLM-5.3 de un vistazo: la ficha técnica

GLM-5.3 es el flagship de agosto 2026 de la familia GLM-5 de Zhipu, y el modelo con la tabla de benchmarks pública más completa de toda la línea GLM. Misma base MoE clase-744B que GLM-5.2, unos 40B activos por token — sin nuevo pretraining, solo una corrida de post-training escalada. Los pesos abiertos llegaron a Hugging Face (zai-org/GLM-5.3) a fines de agosto tras dos semanas de revisión de seguridad, y cada cifra de abajo es un número público de GLM-5.3 con su fuente al final del artículo.

Parámetros

Misma base MoE clase-744B que GLM-5.2, ~40B activos (solo post-training)

Contexto

1M tokens (1.048.576), 128K de salida máxima, solo texto

Licencia

Pesos abiertos — Hugging Face zai-org/GLM-5.3

Precio API

$1.40 / 1M input, $4.40 / 1M output

Coding Plan

Lite desde ~$18/mes, tiers Pro y Max para uso intensivo

Dónde corre

Claude Code, Cline, Kilo Code, Roo Code, OpenClaw + API

Hermano liviano

GLM-5.3-Flash (26 ago): 320B/18B multimodal, MIT, $0.15/$0.50 por 1M

Por qué importa el contexto de 1M

La mayoría de los modelos anuncian contexto largo pero se degradan después de unos cientos de miles de tokens. La característica estrella de GLM-5.3 es una ventana sólida de 1M de tokens que rinde en tareas agénticas de varias horas — eso es exactamente lo que miden los puntajes de Terminal-Bench 3.0 y DeepSWE de abajo.

El linaje es corto y veloz: GLM-4.5 (355B, julio 2025) → GLM-4.6 (contexto 200K, septiembre 2025) → GLM-4.7 (diciembre 2025) → GLM-5 (744B, febrero 2026) → GLM-5.1 (abril 2026) → GLM-5.2 (junio 2026, el ancla verificada: 62.1 SWE-bench Pro, 81.0 Terminal-Bench 2.1) → GLM-5.3 (agosto 2026). Doce días después Z.ai sumó GLM-5.3-Flash: otro modelo distinto, entrenado de cero, 320B/18B nativamente multimodal (imagen + video) que supera a GLM-5.2 a cerca de un décimo del precio de API.

2. Qué mejoró vs GLM-5.2

Un dato enmarca todo: GLM-5.3 reusa el base model de GLM-5.2, así que cada punto de abajo sale del post-training sobre entornos ejecutables, escalados y verificables. Los saltos son grandes justo donde las tareas se parecen al trabajo real de ingeniería. Acá va GLM-5.3 contra GLM-5.2 y la frontera cerrada — todo cifras reportadas por Z.ai desde los docs oficiales y el blog de lanzamiento:

28.3

Terminal-Bench 3.0

Desde 4.6 en GLM-5.2; SOTA abierto según Z.ai, sobre el resto del campo abierto.

66.9

DeepSWE v1.1

Desde 46.2 en GLM-5.2 — un salto de ~45% solo con post-training.

28.5

Agents’ Last Exam

Desde 23.8 en GLM-5.2; SOTA abierto en tareas agénticas de CLI según Z.ai.

84.5%

CyberGym

Desde 77.2% en GLM-5.2; mejor del benchmark, sobre Mythos 5 (83.8%) y GPT-5.6 Sol (83.6%).

54.4%

ExploitBench

Más del doble del 24.4% de GLM-5.2; todavía detrás de Mythos 5 (78.0%) y GPT-5.6 Sol (76.5%).

+50%

Z.ai Code Bench (interno)

Benchmark privado de agentes realistas vs GLM-5.2; en Max 34.5% de completitud con ~75K tokens vs 23.4% con ~96K.

El número que me convenció

Terminal-Bench 3.0 pasando de 4.6 a 28.3 sin un base model nuevo es la diferencia entre una curiosidad de benchmark y un modelo al que le podés entregar una terminal. DeepSWE de 46.2 a 66.9 cuenta la misma historia en largo horizonte — leelo como “el post-training es el nuevo pretraining”, no como un veredicto final sobre la frontera cerrada.

Como referencia, GLM-5.2 sigue siendo el ancla verificada en las suites anteriores: 62.1 en SWE-bench Pro (sobre GPT-5.5 con 58.6, detrás de Claude Opus 4.8 con 69.2) y 81.0 en Terminal-Bench 2.1. La era GLM-5.3 movió la vara a suites más duras — Terminal-Bench 3.0, DeepSWE, Agents’ Last Exam, CyberGym — por eso conviene comparar 5.3 contra 5.2 en el mismo benchmark, nunca entre benchmarks distintos.

3. Quickstart: Claude Code, Cline y API directa

Tenés tres caminos verificados para correr GLM-5.3 hoy: el GLM Coding Plan dentro de Claude Code, cualquier herramienta OpenAI-compatible como Cline, o la API directa de Z.ai con model id glm-5.3. Elegí el que matchee tu setup — las tres URLs de abajo salen directo de la documentación oficial.

Opción A — Claude Code (protocolo Anthropic)

Instalá Claude Code, creá una API key de Z.ai y apuntá Claude Code al endpoint de Coding en ~/.claude/settings.json. Esta forma exacta es la receta documentada de GLM-5.3:

npm install -g @anthropic-ai/claude-code

// ~/.claude/settings.json
{
  "env": {
    "ANTHROPIC_AUTH_TOKEN": "your_zai_api_key",
    "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.3[1m]",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.3[1m]",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
    "API_TIMEOUT_MS": "3000000"
  }
}

cd your-project-directory
claude

Opción B — Cline (protocolo OpenAI-compatible)

En Cline elegí “Use your own API Key” con proveedor OpenAI Compatible, base URL https://api.z.ai/api/coding/paas/v4, modelo glm-5.3, desmarcá Support Images (GLM-5.3 es solo texto) y poné la ventana de contexto en 1000000. Esa es la receta documentada de Cline, verificada en los docs de Z.ai.

Provider:  OpenAI Compatible
Base URL:  https://api.z.ai/api/coding/paas/v4
API Key:   your_zai_api_key
Model:     glm-5.3  (custom model name)
Images:    OFF (uncheck Support Images, GLM-5.3 es solo texto)
Context:   1000000

Opción C — API directa con el SDK de OpenAI en Python

Para scripts y harnesses propios, el endpoint general https://api.z.ai/api/paas/v4/ habla el protocolo chat-completions de OpenAI. Llamada mínima funcional con reasoning activado (obligatorio en GLM-5.3):

pip install --upgrade "openai>=1.0"

from openai import OpenAI

client = OpenAI(
    api_key="your-Z.AI-api-key",
    base_url="https://api.z.ai/api/paas/v4/",
)

completion = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {"role": "system", "content": "You are a senior backend engineer."},
        {"role": "user", "content": "Refactor this function for clarity and add tests."},
    ],
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "max",  # low | high | max (default max)
    },
)
print(completion.choices[0].message.content)

Tip: el thinking es obligatorio, [1m] desbloquea todo el contexto

GLM-5.3 siempre corre con reasoning activado — thinking.type tiene que ser enabled y desactivarlo hace fallar el request; solo tenés el dial de reasoning_effort (low/high/max, max para código difícil). En Claude Code, agregá [1m] al nombre del modelo (glm-5.3[1m]) y poné CLAUDE_CODE_AUTO_COMPACT_WINDOW en 1000000 para desbloquear la ventana completa de 1M.

Atención con los endpoints: la cuota del Coding Plan solo funciona en los endpoints de coding (Anthropic https://api.z.ai/api/anthropic u OpenAI https://api.z.ai/api/coding/paas/v4). Apuntar tu herramienta al endpoint general factura distinto y no consume cuota del plan. ¿Necesitás visión o un tier más barato? Eso es territorio de GLM-5.3-Flash (nativamente multimodal, $0.15/$0.50 por 1M) — no de este flagship.

4. Límites honestos

GLM-5.3 es el modelo open-weights de programación más fuerte que probé este año, pero “más fuerte abierto” no es “mejor en todo”. Acá está donde todavía pierde, para que decidas con los ojos abiertos.

⚠️

Todavía detrás de la frontera cerrada en exploitación

ExploitBench 54.4% vs Mythos 5 con 78.0% y GPT-5.6 Sol con 76.5%; ExploitGym 105/130 vs 181/247 de Mythos 5. Mientras más arriba en la cadena de exploitación, más ancha la brecha restante.

⚠️

Todos los números de lanzamiento son vendor-reported

Z.ai publica métodos y algunas trayectorias, pero son corridas first-party. Re-corren los dos benchmarks que matcheen tu workload antes de migrar un equipo.

⚠️

Solo texto — sin visión

GLM-5.3 recibe solo texto, punto. Si tu workflow necesita screenshots, diagramas o video, eso es GLM-5.3-Flash (nativamente multimodal).

⚠️

El thinking no se puede apagar

El reasoning siempre está activado; thinking.type en disabled hace fallar el request. Solo tenés el dial de reasoning_effort (low/high/max) — presupuestá latencia y tokens en consecuencia.

⚠️

Self-hostear pesos clase-744B no es un proyecto de fin de semana

Pesos abiertos no significa modelo para laptop. Necesitás un clúster multi-GPU con vLLM o SGLang — para la mayoría de los equipos la API hosteada o el Coding Plan es el camino sensato; los pesos MIT 320B de Flash son la opción liviana para self-host.

El error más común

Confundir los dos SKUs. GLM-5.3 es el flagship de programación y ciber-defensa solo-texto; GLM-5.3-Flash es otro modelo distinto, 320B/18B multimodal a un décimo del precio. Elegí el flagship para máxima capacidad de código, Flash para visión y costo.

Ninguno de estos límites es un dealbreaker — son el precio normal de los pesos abiertos en la frontera. La cuenta de costos (mismo $1.40/$4.40 por 1M que GLM-5.2, Flash a un décimo de eso) deja margen de sobra para correr tus propias evals antes de comprometerte.

Veredicto

Si querés programación casi-frontera sin precios de frontera, GLM-5.3 es la respuesta open-weights por defecto en septiembre 2026: 28.3 en Terminal-Bench 3.0, 66.9 en DeepSWE, 28.5 en Agents’ Last Exam, 84.5% en CyberGym, un 1M de contexto real, pesos abiertos y soporte de primera en Claude Code y Cline — con los 62.1 de GLM-5.2 en SWE-bench Pro como fallback verificado.

Mi recomendación: empezá con el tier Lite del Coding Plan en un repo real por dos semanas con el modelo glm-5.3 (reasoning_effort en max), mantené GLM-5.2 como baseline y compará tareas completadas — no screenshots de benchmarks. Si rinde, escalá a Pro; tirá de GLM-5.3-Flash cuando necesites visión o un décimo del costo por token.

En resumen

Usalo para

  • Código agéntico en Claude Code
  • Tareas largas con mucha terminal
  • Ayuda en vulnerability discovery

Evitálo para

  • Workflows con visión/multimodal
  • Toolchains no soportados
  • Expectativas de seguridad ofensiva

Acordate

  • El thinking queda activado
  • [1m] desbloquea todo el contexto
  • Verificá en tu workload

Fuentes

Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego