Saltar a contenido
01 de 06Seguridad en IA

Seguridad en IA

Biblioteca

Series y notas técnicas.

Estás en Seguridad en IA · Presentación.

Serie

Seguridad en IA

6 contenidos

Ver vídeo, resumen y contenidos relacionados

Terminada Técnico ~40 min 5 capítulos

En seguridad de software, una defensa clásica contra las inyecciones consiste en impedir que datos no confiables modifiquen la sintaxis o el significado de una instrucción que ejecuta un intérprete. Esa frontera no resuelve todas las clases de ataque, pero sí evita que esos datos se conviertan en control por el mismo canal. En sistemas con LLMs esa separación deja de ser suficiente, porque el propio motor del sistema consume instrucciones y datos en el mismo medio: lenguaje natural.

Eso cambia la superficie de riesgo de forma estructural. Un documento recuperado por RAG, una observación escrita por otro agente, una salida de herramienta o una nota guardada en memoria pueden influir en el modelo como si fueran instrucciones. Separar privilegios, contexto y ejecución no elimina esa influencia; limita qué datos y acciones puede alcanzar si el modelo la sigue.

La serie no intenta convertir la seguridad en IA en una lista de sustos nuevos. El objetivo es separar mecanismos que suelen confundirse: qué controles reducen la probabilidad de que contenido no confiable altere el comportamiento del modelo y qué controles limitan las consecuencias —datos accesibles, herramientas y acciones— incluso cuando esa influencia ocurre.

Mapa de la serie · una trayectoria, dos resultados

La inyección cambia una propuesta; la arquitectura decide si llega a producir un efecto

Sigue el mismo contenido hostil hasta una decisión de autorización externa al modelo. Cambia únicamente el control y observa dónde diverge el resultado.

Comparar
1Contenido hostilemail · web · documento · memoria
2Llega al sistemaretrieval · lectura · tool result
3Influye en contextocompite con instrucciones legítimas
4Cambia la propuestatexto · plan · tool call
5Frontera de autorizaciónintención · scope · parámetros · aprobacióncontrol fuera del modelo
6Efecto externoenviar · borrar · modificar · exfiltrar
El ataque todavía no ha entrado.

Reproduce la trayectoria y compara qué cambia cuando la autorización vive fuera del modelo.

LISTO
Influencia del modeloUna inyección puede alterar el texto o una propuesta de acción. Prompting, aislamiento de contenido y filtros intentan reducir esta influencia.
Autoridad de ejecuciónPermisos, allowlists, validación de parámetros y aprobación controlan si una propuesta puede convertirse en un efecto externo.

Índice

1. Una orden escondida en un documento puede cambiar lo que hace el sistema

  • Qué se rompe exactamente cuando un LLM procesa el plano de control y el plano de datos en el mismo canal.
  • Por qué la inyección indirecta puede ser más grave cuando el sistema conecta contenido no confiable con herramientas, datos o acciones con privilegios.
  • Qué defensas cambian de verdad la forma del sistema.

2. Pedir al modelo que ignore sus límites

  • Cómo funcionan los ataques que fuerzan al modelo a abandonar sus restricciones.
  • Qué diferencia hay entre un bypass anecdótico y una familia de jailbreaks transferible.
  • Qué papel pueden jugar clasificadores, streaming guards y respuesta rápida.

3. Guardar una señal peligrosa dentro del sistema

  • Qué ocurre cuando el sistema aprende, recuerda o recupera contenido que no debería tratar como confiable.
  • Envenenamiento de bases RAG, memoria de trabajo de agentes y backdoors persistentes.
  • Por qué retirar conocimiento peligroso es más difícil de lo que parece.

4. Probar el camino completo antes del incidente

  • Qué significa evaluar seguridad en sistemas agénticos y no solo en prompts aislados.
  • Qué hay que probar en pipelines con herramientas, memoria y varios pasos.
  • Por qué una captura bonita no basta para medir una cadena causal completa.

5. Limitar lo que el sistema puede leer, cambiar y ejecutar

  • Qué arquitectura defensiva tiene sentido en sistemas reales.
  • Dónde sirven los guardrails y dónde no.
  • Cómo combinar políticas, sandboxing, revisión humana y telemetría sin convertir el producto en algo inútil.

Series relacionadas: Modelos razonadores · Agentes de IA

Ver todas las series

Continúa aprendiendo
Siguiente capítuloPrompt injectionSeguridad en IA