Herramientas · Seguridad · 12

Traza qué puede alcanzar una prompt injection antes de asignar una puntuación de riesgo.

El problema no termina cuando el modelo interpreta una instrucción no confiable. El impacto depende de qué datos, herramientas, canales de salida y memoria puede alcanzar después. Este explorador representa esas rutas y los controles que las cortan, sin generar ejemplos de ataque ni enseñar técnicas ofensivas.

Entradadirecta, indirecta o multimodal
Límitelector aislado frente a modelo privilegiado
Impactodatos, acciones, salida y memoria
Métodoalcanzabilidad determinista, no probabilidad

Escenario

Superficie y privilegios

Controles independientes

Postura modeladano es una probabilidad
Rutas alcanzablesde 5 rutas
Rutas de alto impactoconfidencialidad, integridad o persistencia
Influencia privilegiada

Rutas de impacto

Desvío de instrucciones

Fuga de secretos conocidos en la salida

Acción consecuencial sin aprobación independiente

Exfiltración mediante salida externa

Contaminación persistente de memoria

Controles en el escenario

Lector aisladoaislamiento

Para contenido indirecto, el componente que lee datos no confiables no debería tener el mismo poder que el actor privilegiado.

Mínimo privilegioimpacto

Reduce el daño disponible si el modelo es desviado; no bloquea por sí mismo una ruta binaria ni impide la inyección.

Validación de intenciónacción

Compara la acción propuesta con el objetivo original fuera de la ruta de contenido no confiable.

Confirmación humanaacción

Interpone una aprobación independiente antes de enviar, borrar, comprar, publicar o modificar estado sensible.

Restricción de salidasalida

Limita destinos y canales capaces de sacar información del límite de confianza.

Validación de memoriapersistencia

Impide que contenido influido se convierta automáticamente en estado reutilizable en turnos futuros.

Filtro de secretossalida

Puede bloquear clases conocidas de secretos; no convierte cualquier dato sensible en detectable y es solo una capa defensiva.

Límite: esta herramienta evalúa alcanzabilidad arquitectónica suponiendo que los controles marcados como activos se aplican correctamente. No estima la probabilidad de que un modelo siga una instrucción maliciosa ni la tasa de fallo real de cada control.

Fuentes y criterio

Mitigar el impacto requiere límites fuera del prompt.

OWASP distingue inyección directa e indirecta y recomienda separación de contenido, mínimo privilegio, validación de salida, controles sobre agentes y aprobación humana en operaciones privilegiadas. OpenAI también recomienda limitar accesos y revisar acciones consecuenciales.