💻 Ejecutar Modelos de IA Locales
Cómo ejecutar modelos open-weight en tu propia máquina o servidor: runtimes, hardware, cuantización y cómo conectarlos a tu código y agentes.
¿Por qué ejecutar modelos locales?
Ejecutar modelos en tu propia infraestructura ofrece ventajas estratégicas clave frente a las APIs propietarias en la nube:
- Privacidad Absoluta: Tu código y datos sensibles no salen de tu red local, crucial para entornos corporativos regulados (banca, salud, defensa).
- Coste Marginal Cero: Pagas la inversión en hardware inicial. No hay facturación recurrente por tokens ni límites de consumo mensuales.
- Baja Latencia y Offline: Funciona de forma predecible sin conexión a internet y sin colas de rate limits de proveedores externos.
Usa modelos locales para desarrollo diario, tareas repetitivas de volumen y procesamiento de datos sensibles. Enruta a modelos frontera propietarios (Claude/GPT/Gemini) vía API solo para las tareas complejas de razonamiento o refactorizaciones multi-archivo muy difíciles.
Ollama
★ RecomendadoEl gestor local más popular y sencillo. Descarga, ejecuta y sirve modelos automáticamente con un endpoint compatible con OpenAI en el puerto 11434.
LM Studio
App de EscritorioInterfaz gráfica (GUI) pulida para explorar, descargar de Hugging Face y chatear con modelos. También levanta servidores compatibles con OpenAI en local.
llama.cpp
Bajo nivel / EdgeMotor nativo en C/C++ hiper-optimizado para ejecutar cuantizaciones GGUF. Eficiente en CPU y base oculta de casi todas las herramientas locales.
vLLM
ProducciónMotor de nivel de producción con alto rendimiento (PagedAttention). Ideal para servidores multi-usuario compartidos con GPUs empresariales.
La VRAM (memoria gráfica) de tu tarjeta de video es el recurso crítico. Un modelo en precisión nativa (FP16) requiere unos 2 GB de VRAM por cada 1.000 millones (1B) de parámetros. La cuantización reduce la precisión de los pesos (a 8, 4 o menos bits) para que el modelo ocupe un 75% menos de memoria con una pérdida de calidad mínima.
Q4_K_M reduce la necesidad a unos 0.6 - 0.7 GB por 1B de parámetros. Añade ~1–3 GB extra para el contexto (KV-cache) en ventanas grandes.
| Parámetros | VRAM Mínima (Q4) | GPU Recomendada (Local) | Apple Silicon (RAM Unificada) | Ejemplo de Modelo |
|---|---|---|---|---|
| 3B - 4B | ~3 - 4 GB | GTX 1650 / RTX 3050 (Portátiles) | Mac de 8 GB o superior | Qwen2.5-Coder 3B / Phi-4 (Mini) |
| 7B - 8B | ~6 - 8 GB | RTX 4060 / 3060 / RX 7600 | Mac de 16 GB o superior | Llama-3.1 8B / Qwen2.5-Coder 7B |
| 14B - 15B | ~12 - 16 GB | RTX 4070 / 4070 Ti / 4080 (16GB) | Mac de 24 GB o superior | Qwen2.5-Coder 14B / GLM-4-9B |
| 32B - 34B | ~20 - 24 GB | RTX 3090 / 4090 / RX 7900 XTX | Mac de 36 GB o superior | Qwen2.5-Coder 32B / Yi-Coder 34B |
| 70B - 72B | ~45 - 48 GB | 2x RTX 3090 / 4090 (Multi-GPU) | Mac de 64 GB o superior | Llama-3.3 70B / DeepSeek-V3 (cuantizado) |
OpenCode (Agente de Terminal)
Para configurar el agente de terminal OpenCode con tu modelo local de Ollama, declara un proveedor local compatible en su configuración:
// ~/.config/opencode/opencode.json
{
"provider": {
"local": {
"npm": "@ai-sdk/openai-compatible",
"options": { "baseURL": "http://localhost:11434/v1" },
"models": { "qwen3.5:14b": { "name": "Qwen 3.5 14B (local)" } }
}
}
} Extensiones en IDE (Cline, Continue, Roo Code)
Las extensiones de desarrollo modernas facilitan enormemente el uso de proveedores locales en su barra de configuración:
- Continue: En tu archivo
config.json, añade un bloque en"models"con el proveedor"ollama"y el nombre del modelo. - Cline / Roo Code: Selecciona "OpenAI Compatible" como proveedor, ingresa
http://localhost:11434/v1en Base URL y escribe el nombre del modelo.