AI Models panel · 2026.08

💻 Ejecutar Modelos de IA Locales

Cómo ejecutar modelos open-weight en tu propia máquina o servidor: runtimes, hardware, cuantización y cómo conectarlos a tu código y agentes.

Motores Principales
4
Ollama, LM Studio, vLLM, llama.cpp
GPU Base Recomendada
8 GB
VRAM mínima para modelos de 7B/8B
Cuantización Estándar
Q4_K_M
El punto dulce entre calidad y tamaño
Endpoint Local
localhost:11434
API compatible con OpenAI

¿Por qué ejecutar modelos locales?

Ejecutar modelos en tu propia infraestructura ofrece ventajas estratégicas clave frente a las APIs propietarias en la nube:

  • Privacidad Absoluta: Tu código y datos sensibles no salen de tu red local, crucial para entornos corporativos regulados (banca, salud, defensa).
  • Coste Marginal Cero: Pagas la inversión en hardware inicial. No hay facturación recurrente por tokens ni límites de consumo mensuales.
  • Baja Latencia y Offline: Funciona de forma predecible sin conexión a internet y sin colas de rate limits de proveedores externos.
Regla práctica de arquitectura

Usa modelos locales para desarrollo diario, tareas repetitivas de volumen y procesamiento de datos sensibles. Enruta a modelos frontera propietarios (Claude/GPT/Gemini) vía API solo para las tareas complejas de razonamiento o refactorizaciones multi-archivo muy difíciles.

Runtimes: Motores de Ejecución Elige el runtime adecuado según tu entorno

Ollama

★ Recomendado

El gestor local más popular y sencillo. Descarga, ejecuta y sirve modelos automáticamente con un endpoint compatible con OpenAI en el puerto 11434.

LM Studio

App de Escritorio

Interfaz gráfica (GUI) pulida para explorar, descargar de Hugging Face y chatear con modelos. También levanta servidores compatibles con OpenAI en local.

Descargar LM Studio ↗

llama.cpp

Bajo nivel / Edge

Motor nativo en C/C++ hiper-optimizado para ejecutar cuantizaciones GGUF. Eficiente en CPU y base oculta de casi todas las herramientas locales.

vLLM

Producción

Motor de nivel de producción con alto rendimiento (PagedAttention). Ideal para servidores multi-usuario compartidos con GPUs empresariales.

Dimensionamiento de Hardware y VRAM Estimación de memoria requerida para precisión cuantizada Q4

La VRAM (memoria gráfica) de tu tarjeta de video es el recurso crítico. Un modelo en precisión nativa (FP16) requiere unos 2 GB de VRAM por cada 1.000 millones (1B) de parámetros. La cuantización reduce la precisión de los pesos (a 8, 4 o menos bits) para que el modelo ocupe un 75% menos de memoria con una pérdida de calidad mínima.

El punto dulce: la cuantización Q4_K_M reduce la necesidad a unos 0.6 - 0.7 GB por 1B de parámetros. Añade ~1–3 GB extra para el contexto (KV-cache) en ventanas grandes.
Parámetros VRAM Mínima (Q4) GPU Recomendada (Local) Apple Silicon (RAM Unificada) Ejemplo de Modelo
3B - 4B ~3 - 4 GB GTX 1650 / RTX 3050 (Portátiles) Mac de 8 GB o superior Qwen2.5-Coder 3B / Phi-4 (Mini)
7B - 8B ~6 - 8 GB RTX 4060 / 3060 / RX 7600 Mac de 16 GB o superior Llama-3.1 8B / Qwen2.5-Coder 7B
14B - 15B ~12 - 16 GB RTX 4070 / 4070 Ti / 4080 (16GB) Mac de 24 GB o superior Qwen2.5-Coder 14B / GLM-4-9B
32B - 34B ~20 - 24 GB RTX 3090 / 4090 / RX 7900 XTX Mac de 36 GB o superior Qwen2.5-Coder 32B / Yi-Coder 34B
70B - 72B ~45 - 48 GB 2x RTX 3090 / 4090 (Multi-GPU) Mac de 64 GB o superior Llama-3.3 70B / DeepSeek-V3 (cuantizado)
Conectar tu código (API OpenAI-compatible) Reutiliza tus SDKs cambiando solo el baseURL y API key
SDK oficial: pip install openai
from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
resp = client.chat.completions.create(
    model="qwen3.5:14b",
    messages=[{"role": "user", "content": "Refactoriza este repositorio EF Core"}],
)
print(resp.choices[0].message.content)
Configuración en IDEs y Agentes Conecta tu modelo local a herramientas de desarrollo

OpenCode (Agente de Terminal)

Para configurar el agente de terminal OpenCode con tu modelo local de Ollama, declara un proveedor local compatible en su configuración:

// ~/.config/opencode/opencode.json
{
  "provider": {
    "local": {
      "npm": "@ai-sdk/openai-compatible",
      "options": { "baseURL": "http://localhost:11434/v1" },
      "models": { "qwen3.5:14b": { "name": "Qwen 3.5 14B (local)" } }
    }
  }
}

Extensiones en IDE (Cline, Continue, Roo Code)

Las extensiones de desarrollo modernas facilitan enormemente el uso de proveedores locales en su barra de configuración:

  • Continue: En tu archivo config.json, añade un bloque en "models" con el proveedor "ollama" y el nombre del modelo.
  • Cline / Roo Code: Selecciona "OpenAI Compatible" como proveedor, ingresa http://localhost:11434/v1 en Base URL y escribe el nombre del modelo.
Ollama también se puede configurar de forma directa seleccionando el driver nativo de Ollama en los selectores.
Catálogo de Modelos Open-Weight Modelos open-weight disponibles en este catálogo para ejecutar localmente
22 / 22
Microsoft MIT

Phi-4 (familia)

Tamaño 14B
Contexto 16K
Probar ↗
Meta Llama 4 Community

Llama 4 Maverick

llama-4-maverick
Tamaño 400B
Contexto 1M
Probar ↗
Mistral AI Apache-2.0

Mistral Large 3

mistral-large-3
Tamaño 123B
Contexto 256K
Probar ↗
Mistral AI Apache-2.0

Mistral Small

mistral-small-latest
Tamaño 24B
Contexto 128K
Probar ↗
DeepSeek MIT

DeepSeek V4 Pro

deepseek-v4-pro
Tamaño 1600B
Contexto 128K
Probar ↗
DeepSeek MIT

DeepSeek V3

deepseek-chat
Tamaño 685B
Contexto 128K
Probar ↗
Alibaba (Qwen) Apache-2.0

Qwen3.5 (open-weight)

qwen3.5
Tamaño
Contexto 131K
Probar ↗
Zhipu AI

GLM-5

glm-5
Tamaño 744B
Contexto 200K
Probar ↗
Xiaomi Apache-2.0

MiMo-V2-Pro

mimo-v2-pro
Tamaño
Contexto 256K
Tencent Tencent Hunyuan

Hunyuan Large

Tamaño
Contexto 256K
Moonshot AI

Kimi K3 (max)

Tamaño 2800B
Contexto 1.048576M
Moonshot AI

Kimi K3 (low)

Tamaño 2780B
Contexto 1.048576M
Zhipu AI

GLM-5.2 (max)

Tamaño 753B
Contexto 1M
Moonshot AI

Kimi K2.7 Code

Tamaño 1000B
Contexto 256K
Xiaomi

MiMo-V2.5-Pro

Tamaño 1023B
Contexto 1M
Nex AGI

Nex-N2-Pro

Tamaño 397B
Contexto 262K
Tencent

Hy3

Tamaño 299B
Contexto 256K
DeepSeek

DeepSeek V4 Pro (high)

Tamaño 1600B
Contexto 1M
MiniMax

MiniMax-M3

Tamaño 428B
Contexto 1M
Xiaomi

MiMo-V2.5

Tamaño 310B
Contexto 1M
Alibaba (Qwen)

Qwen3.6 27B

Tamaño 27.8B
Contexto 262K
Thinking Machines

Inkling Small

Tamaño 266B
Contexto 1M