Prefill, decode y presupuesto de latencia
Prefill procesa el contexto en paralelo; decode genera tokens secuencialmente. TTFT, TPOT y throughput miden fases distintas del mismo servicio.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
La petición cambia de forma después del prefill
Consideremos una petición con Lin tokens de entrada y Lout tokens generados.
TTFT mide una frontera visible para el cliente, no una sola operación
En un servicio real podemos descomponer el camino hasta la primera salida así:
En modelos con razonamiento, distingue TTFT de TTFO
La definición concreta del «primer token» también puede cambiar con el tipo de modelo. En AIPerf actual, TTFT llega hasta el primer token de cualquier tipo, incluidos tokens de…
Momentos clave