Todos los vídeos Otros temas 0:36

Speculative decoding y prefix caching

Speculative decoding propone varios tokens baratos y el modelo objetivo los verifica; prefix caching reutiliza trabajo de prefill cuando el prefijo realmente coincide.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

El presupuesto de latencia vuelve a ser el punto de partida

Para una petición servida de forma autoregresiva podemos mantener la descomposición del capítulo 4.1:

02

Prefix caching reutiliza estado de un prefijo ya calculado

En un Transformer autoregresivo, el prefill produce K/V para los tokens de entrada. Si una petición posterior empieza con exactamente el mismo prefijo —según el contrato de identidad del…

03

Un hit sólo existe para la parte realmente reutilizable

Sea una petición con Lin tokens de entrada y Lhit tokens cubiertos por estado KV reutilizable. Definamos una tasa de reutilización por tokens:

Momentos clave

Ve directamente a una sección

  1. El draft propone un bloque de tokens
  2. El verifier acepta un prefijo y rechaza el resto
  3. Un prefix hit evita repetir prefill