Calcula qué ocupa la VRAM durante la inferencia.
Separa pesos, KV cache y reserva de runtime. Cambia precisión, longitud de contexto, concurrencia y número de GPUs para ver qué parte de la memoria está limitando el despliegue.
Una estimación de planificación, no un profiler.
Pesos. La aproximación mínima es parámetros × bits por peso. Los formatos cuantizados pueden añadir escalas, codebooks, padding u otros metadatos; por eso ese overhead es un campo independiente en lugar de quedar oculto.
KV cache. Para atención decoder estándar, cada capa conserva una clave y un valor por cabeza KV, token y secuencia. Con GQA/MQA el número de cabezas KV puede ser menor que el número de cabezas de consulta. Meta publica esta geometría para Llama 3.1 y vLLM trata la KV cache como un presupuesto explícito de memoria GPU.
Varias GPUs. La cifra por GPU supone un reparto ideal y uniforme de pesos y KV cache. Es útil como límite de planificación, pero no modela réplicas, pipeline parallelism, capas no divisibles, buffers de comunicación, offload ni el layout concreto de un backend.
Reserva de runtime. Se aplica como porcentaje editable sobre pesos + KV. Activaciones temporales, CUDA graphs, kernels y allocators dependen del motor y de la carga, por lo que la herramienta no presenta un porcentaje fijo como hecho observado.
La fórmula de KV no representa correctamente arquitecturas con MLA, atención híbrida/sliding-window, estado recurrente o caches comprimidas específicas. En esos casos utiliza el resultado como comparación aproximada y valida el despliegue con métricas reales del motor.
Fuentes primarias: Meta · definiciones de arquitectura Llama, Meta · model card Llama 3.1 y vLLM · configuración de KV cache. Verificadas el 21-08-2026.