Herramientas · Infraestructura · 04

Ve cuánto contexto cabe en la KV cache.

La KV cache crece linealmente con tokens residentes y secuencias concurrentes. Cambia la geometría de atención, la precisión y el presupuesto de memoria para ver cuándo el contexto se convierte en el límite.

Contextotokens × secuencias
Por tokencapas × K/V × cabezas KV
GQA/MQAmenos cabezas KV que query

Arquitectura

Los presets usan la geometría publicada por Meta. Los campos siguen siendo editables.
GQA/MQA reduce este valor frente a las cabezas de consulta.

Carga residente

Memoria disponible solo para KV cache, después de reservar pesos y runtime.
KV cache seleccionadacontexto × concurrencia
KV / token / secuenciacoste marginal de un token residente
Tokens residentescontexto × secuencias
Uso del presupuestosolo del presupuesto de KV configurado
Cómo escala la KV cacheeje X logarítmico
Geometría seleccionada MHA completo Presupuesto KV Máximo del preset
Máx. contexto por memoria
Máx. secuencias por memoria
KV frente a MHA
Ahorro frente a MHA
KV equivalente con MHA
Dimensión por cabeza
Método

La KV cache escala con los tokens que permanecen residentes.

Por token. En atención decoder estándar, cada capa conserva una clave y un valor por cabeza KV. La dimensión de cada cabeza es tamaño_oculto / cabezas_de_atención.

KV_token ≈ capas × 2 × cabezas_KV × dimensión_cabeza × bytes_KV

Contexto y concurrencia. La memoria total se multiplica por el número de tokens de cada secuencia y por las secuencias residentes simultáneamente.

KV_total ≈ KV_token × tokens_contexto × secuencias_concurrentes

GQA y MQA. Reducir cabezas KV disminuye la memoria de cache en la misma proporción, manteniendo separado este efecto de la precisión o la longitud de contexto. El gráfico muestra la geometría seleccionada frente al caso de MHA completo con el mismo número de cabezas de consulta.

Presupuesto. El límite de memoria se aplica únicamente a la KV cache. No representa VRAM total: los pesos, activaciones, CUDA graphs, buffers y otras reservas deben descontarse antes. Para estimar el despliegue completo usa la calculadora de VRAM para inferencia.

La aproximación no modela MLA, atención híbrida o sliding-window, estado recurrente, paginación/fragmentación concreta ni caches comprimidas específicas del backend. En esos casos, valida con métricas reales del motor.

Fuentes primarias: Meta · definiciones de arquitectura Llama, Meta · model card Llama 3.1 y vLLM · configuración de KV cache. Verificadas el 21-08-2026.