Conectar un modelo a documentos, bases de datos o acciones empresariales amplía su utilidad y también su superficie de ataque. Los riesgos ya no terminan en una respuesta incorrecta: una instrucción maliciosa puede intentar revelar información, manipular herramientas o consumir recursos de forma descontrolada.
Trata la salida del modelo como contenido no confiable y limita cada herramienta como si fuera una cuenta externa con permisos mínimos.
Prompt injection y contenido no confiable
Una instrucción oculta en un documento, correo o página puede intentar cambiar el comportamiento del modelo. No existe un filtro perfecto; la defensa combina separación de instrucciones, validación, permisos limitados y confirmación humana para acciones sensibles.
Información sensible
No envíes al modelo más información de la necesaria. Aplica controles de acceso antes de recuperar documentos y evita confiar en que el prompt ocultará datos. Los registros también deben minimizarse y protegerse.
- Autorización por usuario y documento
- Redacción de secretos y datos personales
- Políticas claras de retención
- Pruebas de fuga entre usuarios
Herramientas y salidas
Una respuesta del modelo puede contener comandos, HTML, consultas o parámetros inseguros. Valida contra esquemas estrictos y ejecuta mediante servicios intermedios; nunca entregues acceso directo a producción o una base de datos con privilegios amplios.
Configura límites de tiempo, costo, número de pasos y volumen para reducir el riesgo de consumo sin límites.
Pruebas continuas
Incluye casos adversariales en cada versión: instrucciones contradictorias, documentos manipulados, solicitudes de secretos, llamadas repetidas y errores de proveedores. Monitorea acciones, no únicamente respuestas.
- Evaluaciones antes de publicar
- Alertas por comportamiento anómalo
- Trazabilidad de herramientas
- Procedimiento de respuesta a incidentes
Verified information
Las conclusiones prácticas son elaboración de CyberGCode a partir de documentación primaria.
