Jailbreaks
Cómo los intentos repetidos y adaptativos cambian la superficie de ataque y por qué la autorización y los límites de intentos siguen importando después de una negativa.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
Rechazar una petición no crea una frontera perfecta
Los modelos generativos no ejecutan una política de seguridad como un parser que devuelve siempre el mismo error. Generan tokens condicionados por el contexto. El entrenamiento de…
Probar muchas variantes cambia el coste del ataque
El trabajo sobre ataques universales y transferibles popularizó una idea importante. Un sufijo adversario puede optimizarse para aumentar la probabilidad de que el modelo empiece con una…
El threat model necesita un presupuesto de ataque
Decir que un modelo «resiste jailbreaks» sin declarar cuántos intentos tuvo el atacante es una afirmación incompleta.
Momentos clave