Todos los vídeos Razonamiento 2:01

Riesgos — overthinking, coste, ataques y alineamiento

Overthinking, prompt injection y hijacking de agente en modelos razonadores con herramientas. Criterios para acotar el riesgo en producción.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

1. Sobrepensamiento: cuando más razonamiento deteriora la respuesta

La intuición de que más razonamiento siempre produce mejores respuestas es incorrecta. Existe un fenómeno documentado en modelos razonadores que se llama overthinking (Apple Research,…

02

2. Calidad vs coste vs latencia en producto real

La tríada de tensiones que cualquier sistema de IA generativa tiene que gestionar se agudiza en modelos razonadores.

03

El perfil de la deuda

En modelos sin razonamiento extendido, la deuda de calidad se paga de forma relativamente uniforme: el modelo funciona bien en la distribución de casos para los que fue entrenado y falla…

Texto del vídeo y descripción visual

Este vídeo no contiene voz. La pista de texto reproduce el contenido escrito; las descripciones siguientes explican los elementos visuales.

0:00 — Pensar más tiene un límite.

Apple Research encontró tres regímenes al variar la complejidad: en tareas simples, los modelos estándar pueden superar a los razonadores; en dificultad media, el razonamiento extra ayuda; y en alta complejidad ambos pueden colapsar. El esfuerzo de razonamiento tampoco crece indefinidamente: aumenta con la complejidad hasta un punto y después cae, incluso con presupuesto de tokens disponible.

Descripción visual: Tres columnas para complejidad simple, intermedia y alta revelan ventaja relativa, mejora y colapso; una nota recuerda que el esfuerzo puede dejar de aumentar.

0:25 — El atacante puede estar dentro de los datos.

En una aplicación con RAG, navegador o herramientas, el modelo procesa contenido que el usuario no escribió. Una instrucción maliciosa puede viajar dentro de una página, documento o respuesta de API recuperada. Greshake et al. demostraron que esta inyección indirecta puede manipular la funcionalidad de aplicaciones integradas con LLM y afectar cuándo o cómo se llaman otras APIs.

Descripción visual: Contenido externo cruza una frontera de confianza hacia instrucciones y herramientas; una orden no confiable provoca confusión de autoridad y alcanza la API.

0:50 — La seguridad también abre superficie.

TabooRAG muestra otra ruta: un documento recuperable puede introducir contexto de riesgo relevante para una consulta benigna y provocar una negativa del modelo. El ataque explota criterios de alineamiento compartidos para transferir el bloqueo entre modelos. El riesgo aquí no es una salida dañina, sino perder disponibilidad.

Descripción visual: Una consulta benigna recupera documentos normales o contaminados; el contexto de riesgo cruza criterios de seguridad y termina en una negativa, mostrando un ataque a disponibilidad.

1:12 — Presupuesto y riesgo deben decidirse juntos.

Conformal Thinking replantea el presupuesto de razonamiento como control de riesgo: parar cuando la confianza es suficiente y también cortar instancias que parecen irresolubles dentro del presupuesto. El objetivo no es gastar todos los tokens disponibles, sino cumplir una tasa de error objetivo usando el cómputo donde aporta fiabilidad.

Descripción visual: Un gráfico conceptual de confianza/riesgo muestra zonas de confianza suficiente, continuar evaluando e irresoluble, con dos umbrales de parada y calibración.

1:36 — Capacidad sin control no es autonomía útil.

Un agente robusto limita permisos, valida contenido externo y separa los datos no confiables de las instrucciones con autoridad. Antes de una acción irreversible, añade una frontera de verificación. También fija presupuestos de tiempo, tokens y llamadas a herramientas, mantiene fallbacks explícitos y puede abstenerse. El objetivo es acotar el daño cuando una capa falla.

Descripción visual: Tres barreras, Permisos, Contexto y Verificación, limitan una trayectoria; se añaden presupuestos de tiempo/tokens/tools, un bloqueo previo a acciones irreversibles y fallback/abstención.