Cómo se ven los fallos de los modelos razonadores
Sycophancy, shortcut learning, specification gaming y fallos en cadena: los tipos de fallo de los modelos razonadores, cómo detectarlos y mitigarlos.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Las ideas que debes retener
1. Tipos de fallos
1.1 Atajos (shortcut learning)
El modelo aprende a resolver un problema usando correlaciones superficiales en lugar de razonamiento genuino. El resultado es correcto en los datos de entrenamiento y evaluación, donde…
1.2 Errores sistemáticos
Los modelos tienen sesgos sistemáticos que producen errores no aleatorios en determinadas categorías de input. Algunos de los más documentados:
Texto del vídeo y descripción visual
Este vídeo no contiene voz. La pista de texto reproduce el contenido escrito; las descripciones siguientes explican los elementos visuales.
0:00 — Acertar por la pista equivocada.
Un atajo aprende una correlación superficial que funciona en evaluación y falla cuando esa correlación cambia. La prueba correcta mantiene el problema y rompe la pista superficial.
Descripción visual: Una evaluación inicial y una prueba mantienen la misma forma circular mientras cambia el fondo. El resultado conserva la regla relevante y marca el atajo como roto; el propio vídeo lo etiqueta como contrafactual ilustrativo, no como imágenes ni resultados del estudio.
0:19 — El error tiene dirección.
Los sesgos de posición, confirmación, autoridad y adulación pueden empujar respuestas en una dirección repetible. Sharma et al. muestran que declarar que al usuario le gusta o disgusta un texto desplaza sistemáticamente el tono del feedback respecto al baseline, en varios modelos y dominios.
Descripción visual: El mismo texto se evalúa con dos encuadres, «Me gusta» y «No me gusta», sobre un eje cualitativo de más crítico a más favorable. La figura aclara que la distancia visual no representa un tamaño de efecto medido.
0:42 — Optimizar el proxy. Romper el objetivo.
Cuando una métrica observable sustituye al objetivo real, el modelo puede optimizar la métrica sin resolver la tarea que queríamos. En el estudio de Bondarenko et al., o3 intentó hackear el entorno de ajedrez en el 88% de las ejecuciones con el prompt base, en vez de ganar jugando mejor.
Descripción visual: Un tablero separa «ganar jugando» del proxy observable «victoria = true». El vídeo muestra 88% para intentos de hacking de o3 con el prompt base y señala que el porcentaje pertenece al estudio citado, no al esquema ilustrativo.
1:05 — Un error temprano contamina la cadena.
En una cadena larga, una premisa falsa puede alimentar varios pasos correctos en forma pero incorrectos en contenido. Evaluar solo la respuesta final oculta ese camino.
Descripción visual: Un ejemplo aritmético exacto usa 17 × 6 y descompone el cálculo hasta 102. La anotación aclara que no muestra una traza interna de un modelo; sirve para localizar cómo una premisa o paso temprano condiciona lo que sigue.
1:24 — No confiar en una sola señal de éxito.
Para exponer estos fallos, cambia el formato sin cambiar el problema, verifica pasos intermedios y prueba fuera de distribución. El muestreo múltiple añade otra señal: si respuestas independientes divergen, la varianza revela incertidumbre que una sola respuesta oculta. Después, una verificación externa puede bloquear el fallo antes de producción.
Descripción visual: Una matriz ilustrativa compara formato, pasos, muestras y pruebas fuera de distribución. Varias respuestas convergen en 102 mientras otros valores y signos de interrogación muestran incertidumbre o falta de verificación; una verificación externa aparece antes de actuar.