Modelos razonadores — test-time compute, cadenas de pensamiento y fallos sistemáticos
Cinco capítulos sobre cómo razonan los LLMs: test-time compute, fallos, latencia, coste y riesgos cuando usan herramientas.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Las ideas que debes retener
1. Qué es “razonar” para un LLM
Veremos qué definiciones de razonamiento pueden encajar en el contexto de los LLMs. Nacimiento de los modelos razonadores: o1 de OpenAI como punto de partida. Repaso del paper de Apple…
2. Cómo se ven los fallos de estos sistemas
Los fallos de este tipo de modelos no son aleatorios, definiremos sus diferentes tipos: Atajos, errores sistemáticos, deriva de objetivo y más. Veremos los métodos para detectarlos y…
3. Test-Time Compute
Test-time compute como una nueva ley de escala para la IA generativa. Palancas para aprovechar al máximo esta nueva ley de escala: Más pasos internos, más generación de candidatos, más…
Texto del vídeo y descripción visual
Este vídeo no contiene voz. La pista de texto reproduce el contenido escrito; las descripciones siguientes explican los elementos visuales.
0:00 — Razonar es un proceso.
Un problema complejo puede dividirse en pasos. Esos pasos consumen tiempo y cómputo. Y también pueden fallar.
Descripción visual: La multiplicación ilustrativa 17 × 6 se descompone en 10 × 6 y 7 × 6: 60 + 42 = 102. Una respuesta 104 aparece marcada como incorrecta. La cuadrícula representa la descomposición del cálculo, no un resultado de benchmark.
0:15 — El presupuesto también se decide.
En inferencia puedes invertir más pasos, más muestras, verificación o interacción con herramientas. En algunas tareas eso puede mejorar la respuesta, pero también aumenta coste y latencia.
Descripción visual: Doce unidades de cómputo se reparten entre pasos, muestras y verificación. El reparto es ilustrativo: muestra que un presupuesto se puede asignar de distintas formas, no que exista una distribución óptima universal.
0:35 — Una serie, cinco preguntas.
Primero: qué significa razonar para un LLM. Segundo: cómo fallan estos sistemas. Tercero: cómo usar más cómputo en inferencia. Cuarto: qué ocurre con la latencia y el streaming. Quinto: cuándo más razonamiento introduce nuevos riesgos.
Descripción visual: El mapa conecta razonar con cinco preguntas: qué significa, cómo falla, cómo usar test-time compute, qué ocurre con la latencia y qué riesgos introduce. Calidad, coste y tiempo aparecen como decisiones relacionadas.
0:58 — Pensar más no es gratis.
Más razonamiento puede mejorar la calidad en tareas adecuadas. También consume tiempo, cómputo y dinero. Y puede introducir sobrepensamiento, errores o nuevas superficies de ataque.
Descripción visual: Un triángulo relaciona calidad, coste y latencia, y riesgo alrededor de la tarea. Es una comparación cualitativa: la posición no representa una puntuación ni una medida de rendimiento.