En seguridad de software, una defensa clásica contra las inyecciones consiste en impedir que datos no confiables modifiquen la sintaxis o el significado de una instrucción que ejecuta un intérprete. Esa frontera no resuelve todas las clases de ataque, pero sí evita que esos datos se conviertan en control por el mismo canal. En sistemas con LLMs esa separación deja de ser suficiente, porque el propio motor del sistema consume instrucciones y datos en el mismo medio: lenguaje natural.
Eso cambia la superficie de riesgo de forma estructural. Un documento recuperado por RAG, una observación escrita por otro agente, una salida de herramienta o una nota guardada en memoria pueden influir en el modelo como si fueran instrucciones. Separar privilegios, contexto y ejecución no elimina esa influencia; limita qué datos y acciones puede alcanzar si el modelo la sigue.
La serie no intenta convertir la seguridad en IA en una lista de sustos nuevos. El objetivo es separar mecanismos que suelen confundirse: qué controles reducen la probabilidad de que contenido no confiable altere el comportamiento del modelo y qué controles limitan las consecuencias —datos accesibles, herramientas y acciones— incluso cuando esa influencia ocurre.
Mapa de la serie · una trayectoria, dos resultados
La inyección cambia una propuesta; la arquitectura decide si llega a producir un efecto
Sigue el mismo contenido hostil hasta una decisión de autorización externa al modelo. Cambia únicamente el control y observa dónde diverge el resultado.
Comparar
1Contenido hostilemail · web · documento · memoria
2Llega al sistemaretrieval · lectura · tool result
3Influye en contextocompite con instrucciones legítimas
4Cambia la propuestatexto · plan · tool call
5Frontera de autorizaciónintención · scope · parámetros · aprobacióncontrol fuera del modelo
Reproduce la trayectoria y compara qué cambia cuando la autorización vive fuera del modelo.
LISTO
Influencia del modeloUna inyección puede alterar el texto o una propuesta de acción. Prompting, aislamiento de contenido y filtros intentan reducir esta influencia.
Autoridad de ejecuciónPermisos, allowlists, validación de parámetros y aprobación controlan si una propuesta puede convertirse en un efecto externo.
1. Una orden escondida en un documento puede cambiar lo que hace el sistema¶
Qué se rompe exactamente cuando un LLM procesa el plano de control y el plano de datos en el mismo canal.
Por qué la inyección indirecta puede ser más grave cuando el sistema conecta contenido no confiable con herramientas, datos o acciones con privilegios.
Qué defensas cambian de verdad la forma del sistema.