AI Development

Seguridad MCP 2026: Audita Tus Agentes Antes de Producción

12 de septiembre de 2026
10 min de lectura
Escudo de seguridad escaneando una red de herramientas de agentes IA en un server room
Compartir:

En 2026 el Model Context Protocol se volvió la forma estándar de conectar agentes con herramientas y datos — y ese alcance es la superficie de ataque. Las descripciones de herramientas pueden esconder instrucciones, un servidor confiable puede cambiar de comportamiento de la noche a la mañana, y un skill instalado hace meses puede exfiltrar claves.

En este deep-dive te muestro cómo auditar todo eso con AI-Infra-Guard, la plataforma open-source de red-teaming de Tencent Zhuque Lab: MCP scan, auditoría de Agent Skills, scan de CVEs de infra y jailbreak evaluation — antes de que tu agente llegue a prod.

1. El Problema: Las Herramientas de Tu Agente Son la Superficie de Ataque

Hace un año nos preocupaba el prompt injection en el chat. Hoy el modelo elige y llama herramientas, ejecuta comandos y toca sistemas de negocio — así que cada descripción, schema, output y credencial está dentro del perímetro de confianza. La guía de Microsoft de junio 2026 lo dice claro: cuando un modelo puede actuar, deja de ser un chatbot y se vuelve software que actúa.

🧪

Más de 50.000 skills escaneados

Tencent Zhuque Lab auditó más de 50.000 Agent Skills de ClawHub con A.I.G y encontró vectores de ataque sigilosos más allá de las muestras maliciosas conocidas.

🚨

Más de 4.000 riesgos MCP

Escaneos masivos de marketplaces MCP revelaron más de 4.000 riesgos de seguridad IA y fallos de código, resumidos en un Top 10 de vulnerabilidades MCP.

🪱

Gusano Miasma (junio 2026)

Un ataque supply-chain plantó configs de agentes en 73 repos incluyendo Azure/durabletask — prueba de que skills y configs MCP ya son vectores de malware.

💥

CVEs reales, RCE real

CVE-2025-49596 (RCE en MCP Inspector, CVSS 9.4) y CVE-2025-54136 (MCPoison en Cursor) muestran que fallos en tooling MCP terminan en ejecución remota de código.

El Error Más Común

Revisar el modelo pero nunca las herramientas. Los equipos hacen red-team de prompts mientras instalan servidores MCP y skills con acceso total a archivos, red y credenciales. Los atacantes lo saben: el tool poisoning (OWASP MCP03) esconde instrucciones maliciosas en descripciones inocentes.

La solución es aburrida y efectiva: escanea cada servidor MCP y skill como escaneas dependencias — antes de prod, en cada update, y con gate en CI. Eso es exactamente lo que automatiza AI-Infra-Guard.

2. Conceptos Mínimos: Qué Revisa A.I.G en Realidad

AI-Infra-Guard (más de 6k estrellas, Apache-2.0, v4.1.13 a junio 2026) es una plataforma full-stack de red-teaming con cinco escáneres. Solo necesitás entender cuatro ideas para usarla bien:

🎯

MCP01–MCP10 + 3

El scanner MCP clasifica hallazgos en 10 categorías — exposición de secretos, scope creep, tool poisoning, supply chain, command injection, prompt injection, auth rota, falta de auditoría, servidores shadow, over-sharing de contexto — más Name Confusion, Rug Pull y Tool Shadowing.

🧠

Single-stage vs three-stage

El modo CLI corre una auditoría rápida single-stage (~3x más veloz, salida SARIF para CI). La Web UI corre el pipeline completo: Info Collection → Code Audit → Vulnerability Review, con progreso en tiempo real.

📊

SARIF + security score

La salida CLI es JSON SARIF 2.1.0, consumible por GitHub Code Scanning. Cada proyecto recibe un score: 100 menos deducciones (Critical −100, High −40, Medium −25, Low −10).

🏷️

SkillTrustBench T01–T09

Los veredictos de skills siguen una taxonomía fija con tres resultados: malicious (intención clara de ataque), suspicious (vulnerable sin intención clara) o normal. Sin etiquetas vagas.

🔥

Jailbreak eval + infra scan

Además de herramientas, A.I.G evalúa robustez de prompts con datasets curados (AdvBench, CNSafe, SafeBench) y fingerprinta más de 100 componentes de infra IA contra más de 2.000 CVEs (Ollama, vLLM, ComfyUI, Triton…).

🛡️

Límites de seguridad del scanner

El auditor solo lee dentro del directorio objetivo, nunca ejecuta el skill, usa whitelist de llamadas y trunca outputs grandes — así el scan no se convierte en el exploit.

Cuándo usar cada scanner

MCP Scan para cada servidor que instales o publiques. Skills scan (aig-skill-scan) para cada skill/plugin de agente. Jailbreak eval cuando cambies system prompts o modelos. Infra scan cuando auto-hospedes Ollama, vLLM o ComfyUI. Agent Scan para workflows completos estilo Dify/Coze.

3. Tutorial: Escanea un Servidor MCP en 5 Pasos

Necesitás Docker para la plataforma completa, o solo Python 3.10+ y una API key de LLM para los scanners standalone (cualquier key compatible con OpenRouter sirve). Vamos de cero a gate en CI.

Paso 1 — Levantá la plataforma (un comando)

El camino más rápido es el instalador one-click, o compose si preferís. Importante: A.I.G no tiene autenticación — correlo solo en localhost, nunca en un host público.

curl https://raw.githubusercontent.com/Tencent/AI-Infra-Guard/refs/heads/main/docker.sh | bash
# o manual:
# git clone https://github.com/Tencent/AI-Infra-Guard.git
# cd AI-Infra-Guard && docker-compose up -d

Paso 2 — MCP scan estático desde el CLI

Apuntá mcp-scan a cualquier fuente de servidor. Pre-escanea 14 patrones regex de alto riesgo (curl|bash, metadata cloud, robo de credenciales) y después un agente hace la auditoría profunda. Guardá el SARIF para CI.

cd AI-Infra-Guard/mcp-scan
uv sync  # o: pip install -r requirements.txt
export LLM_API_KEY="sk-or-v1-xxxxx"
python main.py --repo ./my-mcp-server -o result.sarif.json

Paso 3 — Audita Agent Skills igual

Los skills tienen su propio scanner con taxonomía T01–T09. Instalalo de PyPI y apuntalo al directorio del skill (el que contiene SKILL.md) — también verifica consistencia descripción-vs-código.

pip install aig-skill-scan
export LLM_API_KEY="sk-or-v1-xxxxx"
aig-skill-scan --repo ./my-skill --language en -o skill-report.json

Paso 4 — Scan dinámico + jailbreak eval en la Web UI

Abrí http://127.0.0.1:8088, elegí MCP Scan, pegá una URL de GitHub o subí un zip — o escanea un servidor en ejecución para detectar tool-poisoning en comportamiento. Después corre Jailbreak Evaluation antes de cada cambio de system-prompt.

python main.py --server_url "http://localhost:8000/sse" --prompt "Test tool poisoning vulnerabilities"

Paso 5 — Ponelo como gate en CI

Subí el artefacto SARIF con la action oficial para que nuevos hallazgos MCP01–MCP10 bloqueen el merge. Re-escanea en cada update de servidores/skills: los rug pulls solo funcionan si nadie re-chequea.

python main.py --repo ./my-mcp-server -o results.sarif.json
# luego: github/codeql-action/upload-sarif@v3 con path results.sarif.json

Tip: pineá lo que escaneas

Un scan limpio hoy no significa nada si el servidor se auto-actualiza mañana. Pineá versiones, registrá cada servidor en un catálogo y alertá sobre drift en definiciones de herramientas — ese es tu tripwire contra rug pulls.

4. Errores Comunes (y Cómo Evitarlos)

Veo los mismos cinco fallos en equipos que publican agentes. Todos sobreviven la demo y explotan en prod:

❌ Exponer la UI de A.I.G a internet

La plataforma es para red-teaming interno y no trae auth. Bindeala a 127.0.0.1, ponela detrás de tu VPN y nunca reenvíes su puerto — un scanner con acceso a infra es un objetivo jugoso.

❌ Escanear solo estático

Las auditorías de fuente no ven comportamientos solo-runtime como tool shadowing y outputs envenenados. Combiná siempre los scans --repo con un pase dinámico --server_url contra el servidor corriendo.

❌ Darle el universo a las herramientas (MCP02)

Los permisos excesivos son el facilitador #1: una herramienta de lookup read-only con scope de shell convierte cualquier prompt injection en RCE. Declarale least-privilege por herramienta y deja que el scanner lo verifique.

❌ Confiar en descripciones sin pinear

Los rug pulls y Name Confusion explotan confianza en el tiempo y similitud. Re-escanea en cada bump de versión y rechazá overrides de herramientas del mismo nombre desde servidores no confiables.

❌ Saltear el pase de infra + jailbreak

Endureciste las herramientas pero corres un build vulnerable de Ollama/vLLM, o nunca testeaste el system prompt. Corre el infra CVE scan en componentes auto-hospedados y el jailbreak eval en cada cambio de prompt.

Regla de oro

Trata cada servidor MCP y skill como código third-party no confiable: escanealo, pinealo, scopealo y re-escanealo. Si un update no pasa tu gate SARIF, no se publica — sin excepciones para “en la demo funcionaba”.

Conclusión

MCP convirtió agentes de chatbots en software que actúa — así que la seguridad de agentes hoy es seguridad de supply-chain de software. AI-Infra-Guard te da el pipeline que faltaba: auditorías MCP01–MCP10, veredictos T01–T09 para Skills, salida SARIF para CI, más cobertura jailbreak y de infra.

Mi mínimo recomendado antes de que cualquier agente llegue a prod: MCP scan estático, auditoría de skills, un pase dinámico, jailbreak eval del system prompt y gate SARIF en CI. Treinta minutos de setup que previenen exactamente los incidentes que llenan los feeds de CVEs de 2026.

Checklist pre-prod

  • • MCP scan estático en cada servidor (SARIF guardado)
  • • aig-skill-scan en cada skill (malicious/suspicious = bloqueo)
  • • Pase dinámico --server_url para tool poisoning
  • • Jailbreak eval tras cada cambio de system-prompt
  • • Infra CVE scan en runtimes auto-hospedados
  • • Versiones pineadas + alertas de drift + gate SARIF en CI
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego