Desarrollo IA

Unsloth: Corre y Entrena LLMs en tu Propia GPU

12 de septiembre de 2026
9 min de lectura
Estación de trabajo con GPU entrenando un LLM local con Unsloth
Compartir:

Alquilar horas de GPU cada vez que querés experimentar con un LLM sale caro rápido. Unsloth lo da vuelta: es una app open-source que te deja correr y entrenar modelos como Qwen, Kimi K3, DeepSeek y Gemma directo en tu máquina, con fine-tuning 2x más rápido y hasta 80% menos VRAM.

En esta guía te muestro qué es Unsloth, cómo funciona su flujo de 4 pasos, los comandos de instalación verificados, cuánta VRAM necesitás de verdad y cuándo NO conviene usarlo.

1. Qué Es Unsloth: Stars, Licencia y Alcance

Unsloth (github.com/unslothai/unsloth) es, en sus propias palabras, la primera app de escritorio para correr y entrenar modelos en local. Cubre texto, visión, audio, embeddings y difusión: Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4 y FLUX, en formatos GGUF y MLX. Además sirve todo por API compatible con OpenAI, así tus agentes de código usan modelos locales.

Datos del repo (verificados ago–sep 2026)

Stars:~76k estrellas en GitHub
Licencia:Apache-2.0 (repo principal)
Velocidad:Fine-tuning 2x más rápido
Memoria:Hasta 80% menos VRAM
Notebooks:Más de 250 notebooks de fine-tuning y RL
Plataformas:Windows, Linux, macOS, WSL, Docker

La promesa central es eficiencia de memoria: fine-tuning 4-bit QLoRA de Llama 3.1 8B con contextos muy distintos según la placa, y entrenamiento de modelos de razonamiento (GRPO) desde apenas 5GB de VRAM. Los números concretos de sus propios benchmarks están en la sección 3.

¿Cuánta VRAM necesitás? (sus números)

Llama 3.1 8B QLoRA, placa de 8GB~3k de contexto
Llama 3.1 8B QLoRA, placa de 12GB~21k de contexto
Llama 3.1 8B QLoRA, placa de 24GB~78k de contexto
Qwen3-30B-A3Bentra en 17.5GB de VRAM
gpt-oss 20B / 120B14GB / 65GB de VRAM
Entrenamiento GRPOdesde 5GB de VRAM

2. Cómo Funciona: la Arquitectura en 4 Pasos

Unsloth son tres cosas en una: Unsloth Desktop (app nativa, recomendada), Unsloth Studio (UI web) y Unsloth Core (paquete pip para código). Todo flujo sigue los mismos cuatro pasos:

1

Elegí un modelo ya cuantizado

Bajá uno de los quants Dynamic 2.0 de Unsloth desde Hugging Face (4-bit, GGUF o bnb-4bit). El trabajo de cuantización ya está hecho y bencheado, así te salteás la parte más difícil de la inferencia local.

Sin saber de quants
2

Servilo con una API local

Studio sirve el modelo por un endpoint compatible con OpenAI y Anthropic. Apuntá Claude Code, Codex, OpenCode, OpenClaw o cualquier herramienta MCP a localhost y tus agentes corren sobre pesos locales.

Agentes incluidos
3

Fine-tune con QLoRA

Sumá tu dataset en uno de los más de 250 notebooks (SFT, DPO, GRPO, visión, TTS, STT, embeddings), apretá Run All y entrená con kernels 4-bit QLoRA 2x más rápidos y una fracción de la VRAM.

2x más rápido, 80% menos VRAM
4

Exportá a donde quieras

Guardá el resultado como GGUF, safetensors de 16-bit o subilo a Ollama, vLLM, llama.cpp o Hugging Face. Tu fine-tune sale de tu máquina en formato deployable.

GGUF · vLLM · Ollama · HF

3. Quickstart: Comandos de Instalación Verificados

Todos los comandos salen del README oficial y la wiki de instalación. Elegí UN camino: la app de escritorio (más fácil), Studio (UI web) o Core (pip, para notebooks).

Opción A — Studio UI web (Linux, macOS, WSL)

Instalador de una línea y lanzás la UI local:

curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio

Variante segura/remota: unsloth studio --secure (HTTPS vía Cloudflare).

Opción A — Studio UI web (Windows)

Mismo flujo en PowerShell:

irm https://unsloth.ai/install.ps1 | iex
unsloth studio

O descargá la app Desktop nativa para Windows desde unsloth.ai.

Opción B — Core con pip (para notebooks de fine-tuning)

Build CUDA 12.1 + Torch 2.5. Si dudás, corré su script de auto-instalación:

pip install "unsloth[cu121-torch250] @ git+https://github.com/unslothai/unsloth.git"
# --- o auto-detección del build correcto: ---
wget -qO- https://raw.githubusercontent.com/unslothai/unsloth/main/unsloth/_auto_install.py | python

Requiere versiones compatibles de Python + CUDA + torch + triton + xformers.

Servir un modelo (vLLM, compatible OpenAI)

Ejemplo con un quant real de Unsloth, directo de su model card:

pip install vllm
vllm serve "unsloth/Qwen3-4B-Instruct-2507-unsloth-bnb-4bit"
curl -X POST "http://localhost:8000/v1/chat/completions" -H "Content-Type: application/json" --data '{"model": "unsloth/Qwen3-4B-Instruct-2507-unsloth-bnb-4bit", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'

Cualquier cliente OpenAI funciona contra el puerto 8000 desde ahí.

Conectá tu agente de código

Unsloth enchufa modelos locales a los CLIs de agentes con un comando:

unsloth start opencode
# también: unsloth start claude | unsloth start codex | unsloth start openclaw

Atajo GGUF para otros runtimes: ollama run hf.co/unsloth/Qwen3-14B-GGUF:UD-Q4_K_XL

Tip: empezá por un notebook, no desde cero

El repo unslothai/notebooks tiene más de 250 notebooks para principiantes (texto, visión, audio, TTS, embeddings). Agregá tu dataset, clic en Run All, exportá a GGUF/Ollama/vLLM/Hugging Face. Ese camino lo prueban miles de usuarios; los loops de entrenamiento a mano es donde aparecen las sorpresas de VRAM.

4. Casos de Uso Reales

Dónde Unsloth se gana sus estrellas: todo lo que por datos, costo o velocidad de iteración te saca de la nube.

💻

Asistente de código privado

Serví Qwen o DeepSeek en local, apuntá tu CLI de agentes a localhost y programá sin pagar tokens y sin que el código salga de la máquina.

🏥

Fine-tunes de dominio (medicina, legal, soporte)

QLoRA a un modelo 7–8B con tus tickets, docs o normativas. Proyectos estilo MedCoT-7B muestran el patrón: destilar razonamiento a un modelo local chico.

🌍

Deployments offline / aislados

Una vez descargados, los modelos GGUF corren con llama.cpp, Ollama o Docker sin red. Ideal para entornos regulados.

🧪

Experimentos de RL baratos

Entrenamiento de razonamiento GRPO desde ~5GB de VRAM: una sola RTX 3060/4060 corre experimentos de alineación que antes pedían un cluster.

🎨

Generación de imágenes local

FLUX y modelos de difusión corren en la misma UI de Studio, así una sola app cubre tus necesidades de LLM e imágenes.

📦

Publicar quants

Entrená una vez, exportá quants Dynamic 2.0 a Hugging Face y serví los mismos pesos vía vLLM, SGLang o Docker Model Runner.

5. Cuándo NO Usarlo

Unsloth es excelente, pero no reemplaza a la nube. Sé honesto con estos límites antes de comprometerte:

✅ Usá Unsloth cuando…

  • Tenés GPU NVIDIA con CUDA (8GB+ ideal) o Apple Silicon con MLX
  • La privacidad importa: código, medicina, legal o datos internos
  • Entrenás modelos 7–30B con QLoRA/SFT/DPO/GRPO
  • Querés agentes sobre modelos locales vía API compatible OpenAI
  • La factura de GPUs cloud supera el precio de tu propia placa

❌ NO lo uses cuando…

  • Solo tenés CPU o una GPU vieja de 4GB — la inferencia va a gatear
  • Necesitás modelos densos 70B+ a precisión completa (piden 40–80GB VRAM)
  • Querés cero setup: las APIs gerenciadas siguen ganando en comodidad
  • Necesitás entrenamiento multi-GPU hoy (está listado como coming soon)
  • Tu stack es AMD/ROCm o drivers exóticos — esperá fricción

Regla de oro

Si tu modelo entra en tu VRAM en 4-bit y tus datos no pueden salir del edificio, Unsloth es la mejor herramienta en 2026. Si nada de eso aplica, pagá la API y gastá las horas ahorradas en tu producto.

Conclusión

Unsloth se ganó sus ~76k estrellas eliminando las dos excusas para no entrenar en local: es 2x más rápido y pide hasta 80% menos VRAM, y la UI de Studio más los instaladores de una línea eliminaron el dolor del setup. Qwen, Kimi, DeepSeek, Gemma y FLUX corren en hardware que realmente podés tener.

Mi recomendación: instalá Studio esta semana, serví un quant 4–8B, conectalo a tu agente de código y corré un fine-tune de notebook con tus propios datos. Ese loop te enseña más que diez demos en la nube.

Unsloth en 30 segundos

Repo

  • ~76k stars · Apache-2.0
  • Qwen3.8 · Kimi K3 · DeepSeek-V4
  • Gemma 4 · FLUX · GGUF · MLX

Instalación

  • App Desktop (más fácil)
  • curl …/install.sh | sh
  • pip unsloth[…] @ git+…

Guía VRAM

  • QLoRA 8B desde 8GB
  • MoE 30B ≈ 17.5GB
  • GRPO desde 5GB
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego