Ejecución local de modelos
🎧 Podcast: IA privada y local
Guía maestra para ejecutar modelos de lenguaje de código abierto en tu propio equipo, sin depender de servicios externos.
1. Herramientas recomendadas
Para ejecutar un modelo de código abierto localmente existen herramientas que simplifican el proceso sin necesidad de configuraciones complejas. Estas son las opciones más recomendadas actualmente:
- Ollama
- LM Studio
- llama.cpp
La opción más sencilla y rápida.
- Se maneja desde la terminal (o con interfaces que se conectan a él).
- Gestiona automáticamente la descarga y ejecución del modelo.
- Ideal para empezar en minutos.
Ideal si prefieres una interfaz visual.
- Funciona como una "tienda de aplicaciones" de modelos.
- Permite buscar modelos en Hugging Face, descargarlos y chatear con ellos.
- Sin tocar la terminal.
El motor técnico que impulsa a las anteriores.
- Ofrece el máximo control sobre parámetros de hardware.
- Muy eficiente en términos de memoria.
- Requiere algo más de conocimiento técnico.
Si estás empezando, ve directo a Ollama: con un solo comando (ollama run modelo) tendrás un LLM funcionando en tu máquina.
2. Requisitos clave de hardware
Antes de descargar un modelo conviene entender dos conceptos fundamentales que determinarán si puede correr en tu equipo:
2.1 Formato GGUF
Es el estándar de facto para uso doméstico.
- Permite repartir la carga entre tu procesador (CPU) y tu tarjeta gráfica (GPU).
- Hace que modelos grandes funcionen en computadoras normales.
2.2 Cuantización
Para que el modelo quepa en tu RAM o VRAM debes usar versiones cuantizadas (comprimidas).
| Nivel de cuantización | Tamaño en disco | Calidad |
|---|---|---|
| Q8_0 | Grande | Casi idéntica al original |
| Q4_K_M ⭐ | Moderado | Punto ideal: mantiene casi toda la precisión original |
| Q2_K | Muy pequeño | Calidad notablemente reducida |
La cuantización Q4_K_M es el equilibrio recomendado entre tamaño y calidad. Por debajo (Q3, Q2) la degradación se nota; por encima (Q6, Q8) el consumo de memoria crece sin una mejora proporcional.
3. Resumen visual
| Herramienta | Interfaz | Nivel técnico | Mejor para |
|---|---|---|---|
| Ollama | Terminal | Bajo | Empezar rápido |
| LM Studio | Gráfica | Bajo | Explorar modelos visualmente |
| llama.cpp | Terminal | Medio-Alto | Máximo control y eficiencia |
| Concepto | Qué es | Por qué importa |
|---|---|---|
| GGUF | Formato de archivo del modelo | Permite repartir carga entre CPU y GPU |
| Cuantización | Compresión del modelo (Q4_K_M, Q8_0…) | Hace que el modelo quepa en tu hardware |
| Q4_K_M | Cuantización de 4 bits | Equilibrio recomendado tamaño ↔ calidad |
Para ejecutar LLMs en local necesitas tres cosas: una herramienta (Ollama, LM Studio o llama.cpp), un modelo en formato GGUF y una cuantización adecuada (Q4_K_M suele ser el punto ideal) para tu hardware.