Traza qué puede alcanzar una prompt injection antes de asignar una puntuación de riesgo.
El problema no termina cuando el modelo interpreta una instrucción no confiable. El impacto depende de qué datos, herramientas, canales de salida y memoria puede alcanzar después. Este explorador representa esas rutas y los controles que las cortan, sin generar ejemplos de ataque ni enseñar técnicas ofensivas.
Rutas de impacto
—
—
—
—
—
Controles en el escenario
Para contenido indirecto, el componente que lee datos no confiables no debería tener el mismo poder que el actor privilegiado.
Reduce el daño disponible si el modelo es desviado; no bloquea por sí mismo una ruta binaria ni impide la inyección.
Compara la acción propuesta con el objetivo original fuera de la ruta de contenido no confiable.
Interpone una aprobación independiente antes de enviar, borrar, comprar, publicar o modificar estado sensible.
Limita destinos y canales capaces de sacar información del límite de confianza.
Impide que contenido influido se convierta automáticamente en estado reutilizable en turnos futuros.
Puede bloquear clases conocidas de secretos; no convierte cualquier dato sensible en detectable y es solo una capa defensiva.
Límite: esta herramienta evalúa alcanzabilidad arquitectónica suponiendo que los controles marcados como activos se aplican correctamente. No estima la probabilidad de que un modelo siga una instrucción maliciosa ni la tasa de fallo real de cada control.
Mitigar el impacto requiere límites fuera del prompt.
OWASP distingue inyección directa e indirecta y recomienda separación de contenido, mínimo privilegio, validación de salida, controles sobre agentes y aprobación humana en operaciones privilegiadas. OpenAI también recomienda limitar accesos y revisar acciones consecuenciales.