Todos los vídeos Otros temas 0:36

Prefill, decode y presupuesto de latencia

Prefill procesa el contexto en paralelo; decode genera tokens secuencialmente. TTFT, TPOT y throughput miden fases distintas del mismo servicio.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

La petición cambia de forma después del prefill

Consideremos una petición con Lin tokens de entrada y Lout tokens generados.

02

TTFT mide una frontera visible para el cliente, no una sola operación

En un servicio real podemos descomponer el camino hasta la primera salida así:

03

En modelos con razonamiento, distingue TTFT de TTFO

La definición concreta del «primer token» también puede cambiar con el tipo de modelo. En AIPerf actual, TTFT llega hasta el primer token de cualquier tipo, incluidos tokens de…

Momentos clave

Ve directamente a una sección

  1. Prefill construye el estado para decodificar
  2. Decode avanza token a token
  3. TTFT, TPOT y throughput forman el presupuesto