Conectar un modelo a documentos, bases de datos o acciones empresariales amplía su utilidad y también su superficie de ataque. Los riesgos ya no terminan en una respuesta incorrecta: una instrucción maliciosa puede intentar revelar información, manipular herramientas o consumir recursos de forma descontrolada.

Idea principal

Trata la salida del modelo como contenido no confiable y limita cada herramienta como si fuera una cuenta externa con permisos mínimos.

01

Prompt injection y contenido no confiable

Una instrucción oculta en un documento, correo o página puede intentar cambiar el comportamiento del modelo. No existe un filtro perfecto; la defensa combina separación de instrucciones, validación, permisos limitados y confirmación humana para acciones sensibles.

02

Información sensible

No envíes al modelo más información de la necesaria. Aplica controles de acceso antes de recuperar documentos y evita confiar en que el prompt ocultará datos. Los registros también deben minimizarse y protegerse.

  • Autorización por usuario y documento
  • Redacción de secretos y datos personales
  • Políticas claras de retención
  • Pruebas de fuga entre usuarios
03

Herramientas y salidas

Una respuesta del modelo puede contener comandos, HTML, consultas o parámetros inseguros. Valida contra esquemas estrictos y ejecuta mediante servicios intermedios; nunca entregues acceso directo a producción o una base de datos con privilegios amplios.

Configura límites de tiempo, costo, número de pasos y volumen para reducir el riesgo de consumo sin límites.

04

Pruebas continuas

Incluye casos adversariales en cada versión: instrucciones contradictorias, documentos manipulados, solicitudes de secretos, llamadas repetidas y errores de proveedores. Monitorea acciones, no únicamente respuestas.

  • Evaluaciones antes de publicar
  • Alertas por comportamiento anómalo
  • Trazabilidad de herramientas
  • Procedimiento de respuesta a incidentes
Fuentes y referencias

Información verificada

Las conclusiones prácticas son elaboración de CyberGCode a partir de documentación primaria.