Funcionamiento de los Modelos de Lenguaje
🎧 Podcast: Resumen de la unidad de fundamentos.
Un LLM (Large Language Model) funciona fundamentalmente como un generador de texto probabilístico que opera sobre unidades llamadas tokens dentro de un espacio limitado denominado ventana de contexto.
A continuación se detalla el funcionamiento de estos conceptos:
1. El papel de la Probabilidad
A diferencia de los seres humanos, un LLM no "sabe" hechos ni razona; su tarea principal es la predicción estadística.
- Predicción del siguiente token: El modelo analiza todo el texto previo de una conversación y calcula cuál es el fragmento de texto (token) más probable que debería seguir.
- Generación paso a paso: El proceso es iterativo; el modelo genera texto token a token, eligiendo en cada paso el candidato con mayor probabilidad según el contexto que tiene disponible en ese momento.
- Sin acceso externo: El modelo no consulta bases de datos externas ni navega por internet en tiempo real para generar sus respuestas; se basa exclusivamente en los patrones aprendidos durante su entrenamiento y en la información presente en su contexto actual.
2. ¿Qué son los Tokens?
Los tokens son la unidad básica de procesamiento de un LLM. El modelo nunca "ve" palabras o caracteres directamente, sino identificadores numéricos (IDs) de estos fragmentos.
-
Segmentación de texto: Un token puede ser una palabra completa (como "hola"), una sílaba o un solo carácter.
-
Maximización de información: Los algoritmos modernos segmentan el texto buscando que cada token aporte la mayor cantidad de información posible. Por ejemplo, una palabra común puede ser un solo token, mientras que una palabra larga o poco frecuente puede dividirse en 3 o 4 fragmentos.
-
Algoritmos comunes:
- BPE (Byte Pair Encoding): Utilizado por GPT-4 y Claude, fusiona los pares de caracteres más frecuentes.
- WordPiece: Usado por modelos de Google, elige fragmentos que maximizan la probabilidad del corpus total.
- SentencePiece: Utilizado por LLaMA y Mistral, es agnóstico al idioma porque opera sobre bytes crudos.
3. La Ventana de Contexto
El funcionamiento de los tokens y la probabilidad está limitado por la ventana de contexto (context window), que es el número máximo de tokens que el modelo puede procesar en un ciclo de solicitud y respuesta.
- Contenido del contexto: Incluye las instrucciones del sistema (system prompt), los mensajes previos de la conversación y la instrucción actual del usuario.
- Memoria limitada: No existe una "memoria persistente" real fuera de este espacio. Si una conversación excede el límite de la ventana, el modelo "olvida" los primeros tokens porque literalmente ya no forman parte del conjunto de datos que puede procesar para calcular la siguiente probabilidad.
Finalmente, es importante notar que el idioma influye en la eficiencia: el español tiende a consumir entre 1.2 y 1.5 veces más tokens que el inglés para expresar lo mismo, debido a que caracteres como las tildes o la "ñ" a menudo se fragmentan más en el proceso de tokenización.