Todos los vídeos Razonamiento 1:55

Tiempo físico — latencia, streaming e interacción humana

TTFT, streaming y umbrales de latencia percibida en modelos razonadores. RouteLLM, patrones de diseño y gestión de coste de sesión en producción.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

1. Umbrales de latencia percibida

La investigación en experiencia de usuario lleva décadas estudiando cómo la latencia afecta la percepción. Jakob Nielsen estableció en los años 90 una escala que sigue siendo relevante:

02

Enrutamiento dinámico: RouteLLM

Un patrón relevante en este contexto es el enrutamiento dinámico, articulado como técnica bajo el nombre RouteLLM (Ong et al., 2024): en lugar de aplicar el modelo más capaz (y más lento)…

03

2. Streaming y la percepción de latencia

El streaming (enviar tokens al cliente mientras se generan, en lugar de esperar a que la respuesta completa esté lista) es la herramienta más usada para mejorar la percepción de latencia…

Texto del vídeo y descripción visual

Este vídeo no contiene voz. La pista de texto reproduce el contenido escrito; las descripciones siguientes explican los elementos visuales.

0:00 — La espera también es parte del sistema.

Tres umbrales clásicos ayudan a diseñar la espera: 0,1 segundos se siente inmediata, 1 segundo mantiene el flujo y 10 segundos marca el límite aproximado de atención continua. Son referencias de interacción, no leyes universales. Si la operación supera un segundo, la interfaz debe comunicar que sigue trabajando; si supera diez, necesita progreso e interrupción clara.

Descripción visual: Una escala de 0,1 s, 1 s y 10 s marca referencias de interacción; después aparecen controles de actividad e interrupción para esperas mayores.

0:27 — Empezar pronto no es terminar pronto.

TTFT mide desde que se envía la consulta hasta que aparece el primer token visible. La latencia total termina cuando llega el último token. Dos sistemas con el mismo tiempo total pueden sentirse distintos si uno empieza a responder antes. Streaming reduce la espera silenciosa; no elimina el trabajo pendiente.

Descripción visual: Dos barras comparan sistemas con igual duración total pero distinto TTFT, separando el primer token visible del último token.

0:49 — Hacer visible el progreso.

Antes del primer token puede existir trabajo que el usuario no ve. Después, el streaming entrega la respuesta progresivamente mientras continúa la generación. La mejora es perceptual: el usuario recibe señal de vida antes. El tiempo total puede seguir siendo el mismo.

Descripción visual: Una tarjeta de respuesta pasa de espera previa a texto que aparece progresivamente y una barra de progreso, ilustrando señal visible sin afirmar menor tiempo total.

1:09 — No todas necesitan el máximo presupuesto.

RouteLLM aprende a decidir cuándo usar un modelo fuerte y cuándo uno débil para equilibrar calidad y coste. En su evaluación, algunos routers redujeron el coste más de dos veces sin degradar la calidad medida. En producto, esa separación permite asociar rutas rápidas a consultas simples y reservar más capacidad para las difíciles. La política de latencia sigue siendo una decisión del sistema.

Descripción visual: Un router bifurca una consulta hacia menor coste o más capacidad para mostrar asignación dinámica de modelo/presupuesto según la consulta.

1:31 — Latencia como política, no como accidente.

El patrón robusto no es pensar siempre más, sino clasificar la consulta, asignar presupuesto y mostrar progreso antes de que la espera parezca un fallo. Si el presupuesto se agota, el sistema necesita un fallback explícito: respuesta parcial, aclaración, modelo alternativo o error recuperable. Saber parar es parte del diseño.

Descripción visual: Una máquina de estados separa En curso, Completado y Presupuesto agotado, y enumera fallbacks explícitos para evitar esperas indefinidas.