Saltar al contenido principal

Blindaje y Seguridad en el Diseño de Prompts

La seguridad en el diseño de prompts es crítica porque los LLM procesan tanto las instrucciones del sistema como las entradas del usuario como lenguaje natural, lo que los hace vulnerables a que un atacante "anule" las reglas originales. Para mitigar estos riesgos, se recomiendan las siguientes prácticas y técnicas avanzadas:

Idea clave

Los LLM son vulnerables a ataques de inyección de prompts porque no distinguen de forma nativa entre instrucciones del sistema y datos del usuario: ambos llegan como texto plano.


Riesgos y malos usos – Adversarial prompting

Inyección de prompts

Idea clave

Ataque principal: manipular el sistema para ejecutar comandos no autorizados. El objetivo es tomar el control de la salida del modelo utilizando consignas ingeniosas que cambien su comportamiento.

Motivaciones del atacante

Evasión de restricciones de seguridad para generar contenido dañino o ilegal.


1. Tres capas de defensa

Consiste en diseñar el system prompt para que sea más resistente a manipulaciones:

  • Delimitadores y Etiquetas XML: utilizar caracteres únicos (como ### o """) o etiquetas como <instrucciones> para separar claramente las órdenes del sistema de los datos del usuario.
  • Instrucciones de Prohibición y Repetición: incluir reglas explícitas sobre lo que el modelo no debe hacer y repetir estas instrucciones clave para dificultar que sean ignoradas.
  • Autorrecordatorios: añadir frases que insten al modelo a comportarse de manera responsable y a mantenerse en su rol asignado.

2. Resumen rápido por capa de defensa

CapaObjetivo principalTécnicas claveCuándo aplicarla
🛡️ Fortalecimiento del promptHacer que el system prompt sea resistente a manipulaciones.Delimitadores ### / """, etiquetas XML, autorrecordatorios.Diseño inicial del prompt, antes de pasar a producción.
🧩 Mitigaciones técnicasReducir la superficie de ataque con controles de sistema.Clasificador previo, consultas estructuradas, privilegio mínimo en APIs.Arquitecturas multi-LLM o con herramientas/plugins.
🧹 Higiene y monitoreoDetectar y bloquear comportamientos anómalos en producción.Validación de longitud, filtros, human-in-the-loop, SIEM/EDR.Sistemas desplegados o expuestos a usuarios finales.

3. Buenas prácticas en una mirada

Recomendaciones operativas
  • Empieza por el prompt: un system prompt bien delimitado (###, <instrucciones>) ya filtra muchos ataques.
  • Aplica privilegio mínimo: si el LLM no necesita borrar archivos, no le des permiso para hacerlo.
  • Pon un humano en el bucle antes de cualquier acción crítica (borrar, enviar, pagar).
  • Loggea y monitorea las respuestas: los ataques suelen dejar rastros detectables.
Principio de defensa en profundidad

Ninguna de estas técnicas es suficiente por sí sola. Un atacante experimentado puede saltarse un clasificador o reformular un prompt. La seguridad real surge de combinar las tres capas: prompt + arquitectura + monitoreo.