Saltar al contenido principal

Cuantización de LLMs

La cuantización es el proceso que reduce la precisión numérica de los pesos (y a veces de las activaciones) de una red neuronal. En la práctica, convierte valores representados en formatos de alta precisión como FP32 / FP16 a formatos de menor precisión como INT8, INT4 o incluso INT2.

En una frase

Cuantizar = comprimir un modelo para que ocupe menos memoria y se ejecute más rápido, asumiendo una pérdida mínima de calidad.


1. ¿Para qué sirve?

Es la principal herramienta para la economía de la inferencia y la democratización del uso de modelos potentes.

Reducción drástica del tamaño

Un modelo de 70B parámetros puede comprimirse así:

FormatoVRAM necesaria
FP32 (original)~280 GB
4 bits~21 GB

➡️ Permite que quepa en una RTX 4090 u otra tarjeta de consumo.


2. El compromiso: precisión vs. recursos

Reducir los bits implica una pérdida de información, pero las técnicas modernas han logrado que esta pérdida sea mínima para la mayoría de tareas.

BitsCalidadPérdida de precisiónCuándo usarlo
8 bitsExcelentePrácticamente imperceptibleCuando tienes memoria de sobra
4 bitsMuy buenaSolo 1-3% en benchmarks, imperceptible en conversaciones generalesPunto ideal (sweet spot)
2 bitsAceptable5-15% notableSolo en casos de extrema limitación de memoria
Recomendación práctica

Para uso general en local, elige 4 bits: ahorras hasta un ~87% de memoria con una pérdida de calidad casi nula.


3. Formatos y técnicas más importantes

Existen diversos métodos para cuantizar un modelo, cada uno optimizado para un propósito diferente.

GGUF

  • Diseñado por el equipo de llama.cpp.
  • El más versátil.
  • Permite repartir la carga entre CPU y GPU.
  • Ideal para ordenadores personales y Macs con Apple Silicon.

4. Resumen comparativo

FormatoMotorHardware idealFortaleza
GGUFllama.cppCPU + GPU / Apple SiliconVersatilidad y compatibilidad
GPTQGPU NVIDIANVIDIA (inferencia)Velocidad
AWQGPU NVIDIANVIDIA (4 bits)Precisión en 4 bits
EXL2GPU NVIDIANVIDIA (alto rendimiento)Flexibilidad de bits por peso
Idea clave

La cuantización es lo que permite que la tecnología de los grandes modelos de lenguaje —antes reservada a centros de datos masivos— pueda ejecutarse hoy en dispositivos locales y de bajo consumo.