Todos los vídeos Razonamiento 1:22

Qué significa razonar en un LLM

Qué significa razonar para un modelo de lenguaje, qué aportan o1 y DeepSeek R1, y por qué evaluar razonamiento exige mirar pasos, coste y fallos.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

1. Qué significa "razonar" para un humano

En psicología cognitiva, el razonamiento es un proceso deliberado que permite a las personas resolver problemas fuera de los patrones que ya conocen. Se distingue del reconocimiento de…

02

2. Qué pueden hacer los LLMs que se parece al razonamiento

Los LLMs pueden hacer cosas que, a efectos prácticos, producen outputs similares a los del razonamiento humano en muchos contextos.

03

3. El nacimiento de los modelos razonadores: o1 de OpenAI

En septiembre de 2024, OpenAI publicó o1, el primer modelo diseñado explícitamente para "pensar antes de responder". La diferencia respecto a los modelos anteriores no estaba en el tamaño…

Texto del vídeo y descripción visual

Este vídeo no contiene voz. La pista de texto reproduce el contenido escrito; las descripciones siguientes explican los elementos visuales.

0:00 — Qué significa “razonar”?

Operativamente, nos interesa un proceso que descompone problemas en pasos. Consume recursos y tiempo. Y puede fallar de forma sistemática.

Descripción visual: Un ejemplo aritmético verificable muestra 17 × 6 y lo descompone como (10 + 7) × 6 = 60 + 42 = 102. El propio vídeo aclara que es un ejemplo exacto, no una cadena interna observada en un LLM.

0:17 — Verificar resultados, reforzar estrategias.

RLVR usa tareas con resultados verificables para convertir corrección en señal de recompensa. DeepSeek R1 usa GRPO para comparar intentos del mismo problema de forma relativa. En inferencia, el modelo puede dedicar más pasos antes de producir la respuesta final. Entrenamiento e inferencia son dos momentos distintos.

Descripción visual: Un esquema separa ENTRENAMIENTO e INFERENCIA. En entrenamiento, una señal de recompensa verificable actualiza los pesos W y refuerza estrategias; en inferencia, los pesos permanecen fijados mientras un presupuesto de razonamiento conduce a la respuesta final.

0:39 — Más razonamiento, más de una palanca.

Una respuesta puede usar una sola muestra o combinar varias y decidir por consenso. Son estrategias distintas y deben medirse por separado. En AIME 2024, o1 obtuvo 74% con una muestra y 83% con consenso entre 64 muestras. Es evidencia de ese experimento, no una garantía general.

Descripción visual: La animación distingue un ejemplo aritmético ilustrativo con varios intentos de una comparación de resultados reportados para o1 en AIME 2024: 74% con una muestra y 83% con 64 muestras más consenso. El vídeo advierte que consenso y corrección no son equivalentes.

1:02 — La etiqueta importa menos que la curva de fallos.

Los modelos pueden producir cadenas deliberadas y aun así colapsar cuando cambia la complejidad o el presupuesto. Los resultados dependen también del diseño del benchmark y de la evaluación. La práctica útil es medir dónde funciona el razonamiento, cuánto cuesta y cómo falla.

Descripción visual: Una matriz de diseño experimental cruza tarea, presupuesto y verificación con condiciones A, B y C. Las celdas contienen trazos y signos de interrogación: el propio vídeo indica que son condiciones de experimento y no resultados medidos.