Ve cuánto contexto cabe en la KV cache.
La KV cache crece linealmente con tokens residentes y secuencias concurrentes. Cambia la geometría de atención, la precisión y el presupuesto de memoria para ver cuándo el contexto se convierte en el límite.
La KV cache escala con los tokens que permanecen residentes.
Por token. En atención decoder estándar, cada capa conserva una clave y un valor por cabeza KV. La dimensión de cada cabeza es tamaño_oculto / cabezas_de_atención.
Contexto y concurrencia. La memoria total se multiplica por el número de tokens de cada secuencia y por las secuencias residentes simultáneamente.
GQA y MQA. Reducir cabezas KV disminuye la memoria de cache en la misma proporción, manteniendo separado este efecto de la precisión o la longitud de contexto. El gráfico muestra la geometría seleccionada frente al caso de MHA completo con el mismo número de cabezas de consulta.
Presupuesto. El límite de memoria se aplica únicamente a la KV cache. No representa VRAM total: los pesos, activaciones, CUDA graphs, buffers y otras reservas deben descontarse antes. Para estimar el despliegue completo usa la calculadora de VRAM para inferencia.
La aproximación no modela MLA, atención híbrida o sliding-window, estado recurrente, paginación/fragmentación concreta ni caches comprimidas específicas del backend. En esos casos, valida con métricas reales del motor.
Fuentes primarias: Meta · definiciones de arquitectura Llama, Meta · model card Llama 3.1 y vLLM · configuración de KV cache. Verificadas el 21-08-2026.