Herramientas · Seguridad · 12

Traza qué puede alcanzar una prompt injection antes de asignar una puntuación de riesgo.

El problema no termina cuando el modelo interpreta una instrucción no confiable. El impacto depende de qué datos, herramientas, canales de salida y memoria puede alcanzar después. Este explorador representa esas rutas y los controles que las cortan, sin generar ejemplos de ataque ni enseñar técnicas ofensivas.

Entradadirecta, indirecta o multimodal
Límitelector aislado frente a modelo privilegiado
Impactodatos, acciones, salida y memoria
Métodoalcanzabilidad determinista, no probabilidad

Escenario

Superficie y privilegios

Controles independientes

Postura modelada—no es una probabilidad
Rutas alcanzables—de 5 rutas
Rutas de alto impacto—confidencialidad, integridad o persistencia
Influencia privilegiada——

Rutas de impacto

Desvío de instrucciones—

—

Fuga de secretos conocidos en la salida—

—

Acción consecuencial sin aprobación independiente—

—

Exfiltración mediante salida externa—

—

Contaminación persistente de memoria—

—

Controles en el escenario

Lector aisladoaislamiento

Para contenido indirecto, el componente que lee datos no confiables no debería tener el mismo poder que el actor privilegiado.

Mínimo privilegioimpacto

Reduce el daño disponible si el modelo es desviado; no bloquea por sí mismo una ruta binaria ni impide la inyección.

Validación de intenciónacción

Compara la acción propuesta con el objetivo original fuera de la ruta de contenido no confiable.

Confirmación humanaacción

Interpone una aprobación independiente antes de enviar, borrar, comprar, publicar o modificar estado sensible.

Restricción de salidasalida

Limita destinos y canales capaces de sacar información del límite de confianza.

Validación de memoriapersistencia

Impide que contenido influido se convierta automáticamente en estado reutilizable en turnos futuros.

Filtro de secretossalida

Puede bloquear clases conocidas de secretos; no convierte cualquier dato sensible en detectable y es solo una capa defensiva.

Límite: esta herramienta evalúa alcanzabilidad arquitectónica suponiendo que los controles marcados como activos se aplican correctamente. No estima la probabilidad de que un modelo siga una instrucción maliciosa ni la tasa de fallo real de cada control.

Fuentes y criterio

Mitigar el impacto requiere límites fuera del prompt.

OWASP distingue inyección directa e indirecta y recomienda separación de contenido, mínimo privilegio, validación de salida, controles sobre agentes y aprobación humana en operaciones privilegiadas. OpenAI también recomienda limitar accesos y revisar acciones consecuenciales.

Para el modelo conceptual completo de inyección directa e indirecta, límites de confianza y controles fuera del prompt, consulta qué es prompt injection y cómo reducir su superficie de ataque. Este explorador se centra en comprobar qué rutas de impacto siguen siendo alcanzables en una arquitectura concreta.