KV cache, jerarquía de memoria y continuous batching
El KV cache intercambia memoria por menos cómputo repetido; paging y continuous batching coordinan capacidad, admisión y reutilización entre requests activos.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
Qué guarda realmente el KV cache
En atención causal, cuando el modelo ya ha procesado un token, las proyecciones K y V de ese token no necesitan recalcularse desde cero en cada paso posterior. El runtime puede…
Una fórmula útil para estimar memoria — con límites explícitos
Para un transformer autoregresivo de atención completa donde cada capa guarda K y V con forma estándar, una estimación del KV cache de una secuencia es:
Ejemplo ilustrativo, no benchmark
Supongamos una arquitectura ficticia con:
Momentos clave