Ventana de Contexto
1. ¿Qué es la ventana de contexto?
Es la cantidad máxima de tokens que el modelo puede procesar en una sola llamada.
Context Window = input tokens + output tokens
La ventana de contexto no es la "memoria" del modelo: es únicamente el espacio disponible por cada llamada a la API.
2. Tamaños habituales por tipo de modelo
| Tipo de modelo | Ventana de contexto típica |
|---|---|
| Modelos pequeños | 4K – 8K tokens |
| Modelos frontier | 128K – 200K tokens |
| Modelos especializados | 1M+ tokens |
Más tokens de contexto no significan más memoria: cada llamada empieza de cero y solo ve lo que cabe en esa ventana.
3. ¿Qué ocurre cuando se llena?
Cuando la ventana de contexto se llena, el modelo deja de "ver" literalmente la información introducida al principio de la conversación. Los modelos de lenguaje no poseen una "memoria persistente" más allá de lo que cabe en ese espacio limitado de tokens. A continuación se detallan las consecuencias de alcanzar este límite:
- Pérdida de información antigua: Si la conversación se alarga demasiado, los primeros tokens (que pueden incluir instrucciones iniciales o mensajes previos) quedan fuera de la ventana y el modelo simplemente los "olvida" porque ya no forman parte del conjunto de datos que puede procesar.
- Desorientación en la charla: Al no tener acceso a lo que quedó fuera del contexto, el modelo puede "perder el hilo" de la conversación, ya que la información antigua ya no existe para él en ese ciclo de solicitud-respuesta.
- Saturación del espacio: Dentro de la ventana de contexto debe caber todo: el system prompt (instrucciones del sistema), los mensajes anteriores y la instrucción actual del usuario; cada token generado o recibido consume parte de este espacio disponible.
- Necesidad de gestión manual: Debido a esta limitación, a menudo se requieren técnicas específicas para decidir qué información es prioritaria mantener dentro de la ventana y cuál se puede descartar para que el modelo siga siendo efectivo.
4. Coste de una ventana grande
Una ventana más grande no siempre es mejor.
- Los tokens de contexto se cobran igual que los tokens de salida en las APIs de facturación.
- Procesar más tokens implica mayor costo por llamada.
5. Simulador interactivo
🧪 Simulador: ventana de contexto
6. Resumen
Cuando se llena la ventana, el modelo no es que "recuerde mal" los datos antiguos, sino que físicamente ya no están ahí para ser consultados durante la predicción del siguiente token.