Saltar al contenido principal

Ejecución local de modelos

🎧 Podcast: IA privada y local

Guía maestra para ejecutar modelos de lenguaje de código abierto en tu propio equipo, sin depender de servicios externos.

1. Herramientas recomendadas

Para ejecutar un modelo de código abierto localmente existen herramientas que simplifican el proceso sin necesidad de configuraciones complejas. Estas son las opciones más recomendadas actualmente:

La opción más sencilla y rápida.

  • Se maneja desde la terminal (o con interfaces que se conectan a él).
  • Gestiona automáticamente la descarga y ejecución del modelo.
  • Ideal para empezar en minutos.
¿Cuál elegir?

Si estás empezando, ve directo a Ollama: con un solo comando (ollama run modelo) tendrás un LLM funcionando en tu máquina.


2. Requisitos clave de hardware

Antes de descargar un modelo conviene entender dos conceptos fundamentales que determinarán si puede correr en tu equipo:

2.1 Formato GGUF

Es el estándar de facto para uso doméstico.

  • Permite repartir la carga entre tu procesador (CPU) y tu tarjeta gráfica (GPU).
  • Hace que modelos grandes funcionen en computadoras normales.

2.2 Cuantización

Para que el modelo quepa en tu RAM o VRAM debes usar versiones cuantizadas (comprimidas).

Nivel de cuantizaciónTamaño en discoCalidad
Q8_0GrandeCasi idéntica al original
Q4_K_MModeradoPunto ideal: mantiene casi toda la precisión original
Q2_KMuy pequeñoCalidad notablemente reducida
Punto ideal: Q4_K_M

La cuantización Q4_K_M es el equilibrio recomendado entre tamaño y calidad. Por debajo (Q3, Q2) la degradación se nota; por encima (Q6, Q8) el consumo de memoria crece sin una mejora proporcional.


3. Resumen visual

HerramientaInterfazNivel técnicoMejor para
OllamaTerminalBajoEmpezar rápido
LM StudioGráficaBajoExplorar modelos visualmente
llama.cppTerminalMedio-AltoMáximo control y eficiencia
ConceptoQué esPor qué importa
GGUFFormato de archivo del modeloPermite repartir carga entre CPU y GPU
CuantizaciónCompresión del modelo (Q4_K_M, Q8_0…)Hace que el modelo quepa en tu hardware
Q4_K_MCuantización de 4 bitsEquilibrio recomendado tamaño ↔ calidad
Idea clave

Para ejecutar LLMs en local necesitas tres cosas: una herramienta (Ollama, LM Studio o llama.cpp), un modelo en formato GGUF y una cuantización adecuada (Q4_K_M suele ser el punto ideal) para tu hardware.