Harness de software para sistemas de IA
Agente = Modelo + Harness
El modelo aporta el razonamiento y la predicción probabilística de tokens. El harness aporta la infraestructura de software que permite convertir ese razonamiento en acciones controladas en el mundo real.
🎧 Podcast: Harness de software
Del modelo al agente
Como ya vimos el modelo por sí solo no ejecuta código, no consulta una base de datos, no interactúa con un sistema de archivos y no conserva estado entre peticiones.
El harness, también llamado arnés, es el conjunto de código, infraestructura y lógica externa que rodea al modelo para controlar, guiar y validar su comportamiento. Si el LLM es la CPU, el harness representa el sistema operativo y los sistemas de control que permiten que el ordenador funcione.
| Capa | Responsabilidad |
|---|---|
| Modelo | Razona y genera una salida mediante predicción probabilística de tokens. |
| Harness | Gestiona contexto, herramientas, estado, seguridad y ejecución. |
| Agente | Combina ambas capas para completar tareas mediante ciclos de razonamiento y acción. |

Responsabilidades de un harness de propósito general
Un harness de producción agrupa tres responsabilidades principales.
1. Ingeniería de contexto y memoria
Los LLM son stateless (no mantienen estado) por defecto. El harness decide activamente:
- qué información entra y permanece en la ventana de contexto;
- qué partes del historial se resumen mediante compactación;
- qué documentos se recuperan mediante RAG;
- qué datos deben persistir entre sesiones.
Esta selección convierte el contexto en una memoria de trabajo precisa. También evita desperdiciar tokens y reduce el context rot: la degradación del rendimiento provocada por un contexto saturado, irrelevante o mal organizado.
2. Orquestación de herramientas con guardarraíles
El harness actúa como intermediario entre el modelo y el sistema exterior. Expone herramientas como APIs, bases de datos, navegadores, comandos o sistemas de archivos, pero mantiene el control efectivo de su ejecución.
- El modelo genera una petición de uso de herramienta.
- El harness comprueba que la herramienta existe y valida sus argumentos.
- Aplica permisos, aislamiento o aprobación humana cuando la acción es sensible.
- Ejecuta la operación y devuelve el resultado al modelo como nuevo contexto.
Los guardarraíles pueden incluir validación de esquemas, comprobaciones de tipos, ejecución en sandboxes y aprobaciones con humano en el bucle antes de realizar acciones de alto impacto.
3. Gestión del ciclo de vida y del estado
Un agente necesita continuar trabajando aunque una operación falle o requiera varios pasos. El harness implementa bucles de control persistentes, como ReAct:
Razonar → Actuar → Observar → Razonar de nuevo
Además, mantiene el estado del proceso y gestiona reintentos, checkpoints de progreso y recuperación ante fallos para evitar que toda la sesión termine por un error puntual.
El bucle de ejecución externo
El modelo no ejecuta directamente las acciones que propone. El ciclo ocurre fuera del LLM:
- El harness construye el contexto y envía la petición al modelo.
- El modelo devuelve texto, una señal de fin de secuencia o una llamada a herramienta.
- El harness interpreta y valida la salida.
- Si existe una llamada a herramienta, ejecuta la acción en el sistema.
- El resultado vuelve al modelo en una nueva interacción.
- El ciclo continúa hasta completar la tarea o alcanzar una condición de parada.
El modelo puede proponer una acción o redactar los argumentos de una herramienta, pero es el harness quien decide si se permite y quien la ejecuta realmente.
Verificación, seguridad y observabilidad
Como la salida del modelo es probabilística, puede contener errores o información inventada. El harness funciona como una capa estructural de ingeniería que puede verificar el resultado mediante:
- validaciones de formato y tipos;
- pruebas obligatorias;
- navegadores headless;
- agentes revisores adicionales;
- políticas de permisos y aislamiento;
- intervención humana en decisiones críticas.
También puede registrar cada petición, acción, resultado y error. Esta observabilidad y auditoría permite reconstruir lo ocurrido, medir el comportamiento del agente y detectar fallos en producción.
Harness de aplicación y harness de evaluación
El término harness también se usa en dos contextos relacionados, pero distintos:
| Tipo | Objetivo |
|---|---|
| Harness de aplicación | Rodear al modelo con contexto, herramientas, estado y controles para completar tareas reales. |
| Evaluation harness | Someter modelos a pruebas y benchmarks estandarizados para medir cuantitativamente su precisión y razonamiento. |
Un evaluation harness, no busca operar una aplicación de negocio. Su función es proporcionar un entorno de pruebas repetible para comparar modelos y medir su rendimiento en diferentes tareas.
Resumen
- El modelo predice tokens y aporta capacidad de razonamiento.
- El harness transforma esas predicciones en un proceso controlado y ejecutable.
- La ingeniería de contexto determina qué información utiliza el modelo.
- La orquestación conecta el razonamiento con herramientas reales.
- Los guardarraíles, la validación y la observabilidad aportan seguridad y trazabilidad.
- El estado, los reintentos y los checkpoints permiten completar tareas largas o recuperarse de fallos.
La capacidad práctica de un agente no depende únicamente del modelo. También depende de la calidad del harness que organiza su contexto, controla sus acciones y verifica sus resultados.