Todos los vídeos Seguridad en IA 1:00

Jailbreaks

Cómo los intentos repetidos y adaptativos cambian la superficie de ataque y por qué la autorización y los límites de intentos siguen importando después de una negativa.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

Rechazar una petición no crea una frontera perfecta

Los modelos generativos no ejecutan una política de seguridad como un parser que devuelve siempre el mismo error. Generan tokens condicionados por el contexto. El entrenamiento de…

02

Probar muchas variantes cambia el coste del ataque

El trabajo sobre ataques universales y transferibles popularizó una idea importante. Un sufijo adversario puede optimizarse para aumentar la probabilidad de que el modelo empiece con una…

03

El threat model necesita un presupuesto de ataque

Decir que un modelo «resiste jailbreaks» sin declarar cuántos intentos tuvo el atacante es una afirmación incompleta.

Momentos clave

Ve directamente a una sección

  1. De una negativa a una búsqueda
  2. Optimización, transferencia y presupuesto
  3. Aleatoriedad y autorización como fronteras distintas