Red-teaming
Cómo probar la cadena causal completa desde una entrada adversaria hasta autorización, efecto externo, recuperación y una regresión reproducible de release.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
El threat model viene antes que el benchmark
Antes de elegir un dataset o una métrica, una evaluación debería fijar al menos:
Separar lo que el modelo sabe hacer de lo que el sistema ejecuta
Una evaluación debería separar al menos tres niveles:
Probar el modelo y probar el producto son experimentos distintos
Para estudiar capacidad base puede tener sentido evaluar configuraciones con mitigaciones reducidas o desactivadas. El objetivo no es desplegarlas, sino evitar confundir «el sistema…
Momentos clave