Speculative decoding y prefix caching
Speculative decoding propone varios tokens baratos y el modelo objetivo los verifica; prefix caching reutiliza trabajo de prefill cuando el prefijo realmente coincide.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
El presupuesto de latencia vuelve a ser el punto de partida
Para una petición servida de forma autoregresiva podemos mantener la descomposición del capítulo 4.1:
Prefix caching reutiliza estado de un prefijo ya calculado
En un Transformer autoregresivo, el prefill produce K/V para los tokens de entrada. Si una petición posterior empieza con exactamente el mismo prefijo —según el contrato de identidad del…
Un hit sólo existe para la parte realmente reutilizable
Sea una petición con Lin tokens de entrada y Lhit tokens cubiertos por estado KV reutilizable. Definamos una tasa de reutilización por tokens:
Momentos clave