Todos los vídeos Otros temas 0:36

KV cache, jerarquía de memoria y continuous batching

El KV cache intercambia memoria por menos cómputo repetido; paging y continuous batching coordinan capacidad, admisión y reutilización entre requests activos.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

Qué guarda realmente el KV cache

En atención causal, cuando el modelo ya ha procesado un token, las proyecciones K y V de ese token no necesitan recalcularse desde cero en cada paso posterior. El runtime puede…

02

Una fórmula útil para estimar memoria — con límites explícitos

Para un transformer autoregresivo de atención completa donde cada capa guarda K y V con forma estándar, una estimación del KV cache de una secuencia es:

03

Ejemplo ilustrativo, no benchmark

Supongamos una arquitectura ficticia con:

Momentos clave

Ve directamente a una sección

  1. El KV cache ocupa capacidad por secuencia
  2. Continuous batching recompone el batch en cada paso
  3. Paging convierte capacidad en páginas asignables