Saltar al contenido principal

Harness de software para sistemas de IA

Idea clave

Agente = Modelo + Harness

El modelo aporta el razonamiento y la predicción probabilística de tokens. El harness aporta la infraestructura de software que permite convertir ese razonamiento en acciones controladas en el mundo real.

🎧 Podcast: Harness de software

Del modelo al agente

Como ya vimos el modelo por sí solo no ejecuta código, no consulta una base de datos, no interactúa con un sistema de archivos y no conserva estado entre peticiones.

El harness, también llamado arnés, es el conjunto de código, infraestructura y lógica externa que rodea al modelo para controlar, guiar y validar su comportamiento. Si el LLM es la CPU, el harness representa el sistema operativo y los sistemas de control que permiten que el ordenador funcione.

CapaResponsabilidad
ModeloRazona y genera una salida mediante predicción probabilística de tokens.
HarnessGestiona contexto, herramientas, estado, seguridad y ejecución.
AgenteCombina ambas capas para completar tareas mediante ciclos de razonamiento y acción.
Arnés de IA

Responsabilidades de un harness de propósito general

Un harness de producción agrupa tres responsabilidades principales.

1. Ingeniería de contexto y memoria

Los LLM son stateless (no mantienen estado) por defecto. El harness decide activamente:

  • qué información entra y permanece en la ventana de contexto;
  • qué partes del historial se resumen mediante compactación;
  • qué documentos se recuperan mediante RAG;
  • qué datos deben persistir entre sesiones.

Esta selección convierte el contexto en una memoria de trabajo precisa. También evita desperdiciar tokens y reduce el context rot: la degradación del rendimiento provocada por un contexto saturado, irrelevante o mal organizado.

2. Orquestación de herramientas con guardarraíles

El harness actúa como intermediario entre el modelo y el sistema exterior. Expone herramientas como APIs, bases de datos, navegadores, comandos o sistemas de archivos, pero mantiene el control efectivo de su ejecución.

  1. El modelo genera una petición de uso de herramienta.
  2. El harness comprueba que la herramienta existe y valida sus argumentos.
  3. Aplica permisos, aislamiento o aprobación humana cuando la acción es sensible.
  4. Ejecuta la operación y devuelve el resultado al modelo como nuevo contexto.

Los guardarraíles pueden incluir validación de esquemas, comprobaciones de tipos, ejecución en sandboxes y aprobaciones con humano en el bucle antes de realizar acciones de alto impacto.

3. Gestión del ciclo de vida y del estado

Un agente necesita continuar trabajando aunque una operación falle o requiera varios pasos. El harness implementa bucles de control persistentes, como ReAct:

Razonar → Actuar → Observar → Razonar de nuevo

Además, mantiene el estado del proceso y gestiona reintentos, checkpoints de progreso y recuperación ante fallos para evitar que toda la sesión termine por un error puntual.

El bucle de ejecución externo

El modelo no ejecuta directamente las acciones que propone. El ciclo ocurre fuera del LLM:

  1. El harness construye el contexto y envía la petición al modelo.
  2. El modelo devuelve texto, una señal de fin de secuencia o una llamada a herramienta.
  3. El harness interpreta y valida la salida.
  4. Si existe una llamada a herramienta, ejecuta la acción en el sistema.
  5. El resultado vuelve al modelo en una nueva interacción.
  6. El ciclo continúa hasta completar la tarea o alcanzar una condición de parada.
Responsabilidad de ejecución

El modelo puede proponer una acción o redactar los argumentos de una herramienta, pero es el harness quien decide si se permite y quien la ejecuta realmente.

Verificación, seguridad y observabilidad

Como la salida del modelo es probabilística, puede contener errores o información inventada. El harness funciona como una capa estructural de ingeniería que puede verificar el resultado mediante:

  • validaciones de formato y tipos;
  • pruebas obligatorias;
  • navegadores headless;
  • agentes revisores adicionales;
  • políticas de permisos y aislamiento;
  • intervención humana en decisiones críticas.

También puede registrar cada petición, acción, resultado y error. Esta observabilidad y auditoría permite reconstruir lo ocurrido, medir el comportamiento del agente y detectar fallos en producción.

Harness de aplicación y harness de evaluación

El término harness también se usa en dos contextos relacionados, pero distintos:

TipoObjetivo
Harness de aplicaciónRodear al modelo con contexto, herramientas, estado y controles para completar tareas reales.
Evaluation harnessSometer modelos a pruebas y benchmarks estandarizados para medir cuantitativamente su precisión y razonamiento.

Un evaluation harness, no busca operar una aplicación de negocio. Su función es proporcionar un entorno de pruebas repetible para comparar modelos y medir su rendimiento en diferentes tareas.

Resumen

  • El modelo predice tokens y aporta capacidad de razonamiento.
  • El harness transforma esas predicciones en un proceso controlado y ejecutable.
  • La ingeniería de contexto determina qué información utiliza el modelo.
  • La orquestación conecta el razonamiento con herramientas reales.
  • Los guardarraíles, la validación y la observabilidad aportan seguridad y trazabilidad.
  • El estado, los reintentos y los checkpoints permiten completar tareas largas o recuperarse de fallos.
Conclusión

La capacidad práctica de un agente no depende únicamente del modelo. También depende de la calidad del harness que organiza su contexto, controla sus acciones y verifica sus resultados.