Saltar al contenido principal

Harness de software para sistemas de IA

Idea clave

Agente = Modelo + Harness

El modelo aporta el razonamiento y la predicción probabilística de tokens. El harness aporta la infraestructura de software que permite convertir ese razonamiento en acciones controladas en el mundo real.

🎧 Podcast: Harness de software


Del modelo al agente​

Como ya vimos el modelo por sí solo no ejecuta código, no consulta una base de datos, no interactúa con un sistema de archivos y no conserva estado entre peticiones.

El harness, también llamado arnés, es el conjunto de código, infraestructura y lógica externa que rodea al modelo para controlar, guiar y validar su comportamiento. Si el LLM es la CPU, el harness representa el sistema operativo y los sistemas de control que permiten que el ordenador funcione.

CapaResponsabilidad
ModeloRazona y genera una salida mediante predicción probabilística de tokens.
HarnessGestiona contexto, herramientas, estado, seguridad y ejecución.
AgenteCombina ambas capas para completar tareas mediante ciclos de razonamiento y acción.
Arnés de IA

Responsabilidades de un harness de propósito general​

Un harness de producción agrupa tres responsabilidades principales.

1. Ingeniería de contexto y memoria​

Los LLM son stateless (no mantienen estado) por defecto. El harness decide activamente:

  • qué información entra y permanece en la ventana de contexto;
  • qué partes del historial se resumen mediante compactación;
  • qué documentos se recuperan mediante RAG;
  • qué datos deben persistir entre sesiones.

Esta selección convierte el contexto en una memoria de trabajo precisa. También evita desperdiciar tokens y reduce el context rot: la degradación del rendimiento provocada por un contexto saturado, irrelevante o mal organizado.

2. Orquestación de herramientas con guardarraíles​

El harness actúa como intermediario entre el modelo y el sistema exterior. Expone herramientas como APIs, bases de datos, navegadores, comandos o sistemas de archivos, pero mantiene el control efectivo de su ejecución.

  1. El modelo genera una petición de uso de herramienta.
  2. El harness comprueba que la herramienta existe y valida sus argumentos.
  3. Aplica permisos, aislamiento o aprobación humana cuando la acción es sensible.
  4. Ejecuta la operación y devuelve el resultado al modelo como nuevo contexto.

Los guardarraíles pueden incluir validación de esquemas, comprobaciones de tipos, ejecución en sandboxes y aprobaciones con humano en el bucle antes de realizar acciones de alto impacto.

3. Gestión del ciclo de vida y del estado​

Un agente necesita continuar trabajando aunque una operación falle o requiera varios pasos. El harness implementa bucles de control persistentes, como ReAct:

Razonar → Actuar → Observar → Razonar de nuevo

Además, mantiene el estado del proceso y gestiona reintentos, checkpoints de progreso y recuperación ante fallos para evitar que toda la sesión termine por un error puntual.


El bucle de ejecución externo​

El modelo no ejecuta directamente las acciones que propone. El ciclo ocurre fuera del LLM:

  1. El harness construye el contexto y envía la petición al modelo.
  2. El modelo devuelve texto, una señal de fin de secuencia o una llamada a herramienta.
  3. El harness interpreta y valida la salida.
  4. Si existe una llamada a herramienta, ejecuta la acción en el sistema.
  5. El resultado vuelve al modelo en una nueva interacción.
  6. El ciclo continúa hasta completar la tarea o alcanzar una condición de parada.
Responsabilidad de ejecución

El modelo puede proponer una acción o redactar los argumentos de una herramienta, pero es el harness quien decide si se permite y quien la ejecuta realmente.


Verificación, seguridad y observabilidad​

Como la salida del modelo es probabilística, puede contener errores o información inventada. El harness funciona como una capa estructural de ingeniería que puede verificar el resultado mediante:

  • validaciones de formato y tipos;
  • pruebas obligatorias;
  • navegadores headless;
  • agentes revisores adicionales;
  • políticas de permisos y aislamiento;
  • intervención humana en decisiones críticas.

También puede registrar cada petición, acción, resultado y error. Esta observabilidad y auditoría permite reconstruir lo ocurrido, medir el comportamiento del agente y detectar fallos en producción.


Harness de aplicación y harness de evaluación​

El término harness también se usa en dos contextos relacionados, pero distintos:

TipoObjetivo
Harness de aplicaciónRodear al modelo con contexto, herramientas, estado y controles para completar tareas reales.
Evaluation harnessSometer modelos a pruebas y benchmarks estandarizados para medir cuantitativamente su precisión y razonamiento.

Un evaluation harness, no busca operar una aplicación de negocio. Su función es proporcionar un entorno de pruebas repetible para comparar modelos y medir su rendimiento en diferentes tareas.


Resumen​

  • El modelo predice tokens y aporta capacidad de razonamiento.
  • El harness transforma esas predicciones en un proceso controlado y ejecutable.
  • La ingeniería de contexto determina qué información utiliza el modelo.
  • La orquestación conecta el razonamiento con herramientas reales.
  • Los guardarraíles, la validación y la observabilidad aportan seguridad y trazabilidad.
  • El estado, los reintentos y los checkpoints permiten completar tareas largas o recuperarse de fallos.
Conclusión

La capacidad práctica de un agente no depende únicamente del modelo. También depende de la calidad del harness que organiza su contexto, controla sus acciones y verifica sus resultados.