Herramientas · Infraestructura · 03

Calcula qué ocupa la VRAM durante la inferencia.

Separa pesos, KV cache y reserva de runtime. Cambia precisión, longitud de contexto, concurrencia y número de GPUs para ver qué parte de la memoria está limitando el despliegue.

Pesosparámetros × bits
KV cachecapas × K/V × cabezas × tokens
Capacidadreparto ideal entre GPUs

Arquitectura

Los presets usan la geometría publicada por Meta. Todos los campos siguen siendo editables.
GQA/MQA reduce este valor frente al número total de cabezas.

Escenario de inferencia

Por ejemplo: 16 para BF16/FP16, 8 u 4 para una aproximación cuantizada.
Representa secuencias residentes simultáneamente en la KV cache.

Hardware y reserva

Añade escalas, metadatos u overhead del formato si los conoces.
Reserva explícita para activaciones temporales, kernels y allocator. No es un valor universal.
VRAM total estimadapesos + KV cache + reserva
Pesosincluye el overhead de formato configurado
KV cachecontexto × secuencias concurrentes
Memoria por GPU
De dónde sale la memoriaestimación total
PesosKV cacheReserva de runtime
KV / token / secuencia
Contexto máximo aproximado
Secuencias máximas aproximadas
Dimensión por cabeza
KV frente a MHA
Holgura de VRAM
Método

Una estimación de planificación, no un profiler.

Pesos. La aproximación mínima es parámetros × bits por peso. Los formatos cuantizados pueden añadir escalas, codebooks, padding u otros metadatos; por eso ese overhead es un campo independiente en lugar de quedar oculto.

memoria_pesos ≈ parámetros × bits_peso / 8 × (1 + overhead_formato)

KV cache. Para atención decoder estándar, cada capa conserva una clave y un valor por cabeza KV, token y secuencia. Con GQA/MQA el número de cabezas KV puede ser menor que el número de cabezas de consulta. Meta publica esta geometría para Llama 3.1 y vLLM trata la KV cache como un presupuesto explícito de memoria GPU.

KV ≈ capas × 2 × cabezas_KV × dimensión_cabeza × bytes_KV × tokens × secuencias

Varias GPUs. La cifra por GPU supone un reparto ideal y uniforme de pesos y KV cache. Es útil como límite de planificación, pero no modela réplicas, pipeline parallelism, capas no divisibles, buffers de comunicación, offload ni el layout concreto de un backend.

Reserva de runtime. Se aplica como porcentaje editable sobre pesos + KV. Activaciones temporales, CUDA graphs, kernels y allocators dependen del motor y de la carga, por lo que la herramienta no presenta un porcentaje fijo como hecho observado.

La fórmula de KV no representa correctamente arquitecturas con MLA, atención híbrida/sliding-window, estado recurrente o caches comprimidas específicas. En esos casos utiliza el resultado como comparación aproximada y valida el despliegue con métricas reales del motor.

Fuentes primarias: Meta · definiciones de arquitectura Llama, Meta · model card Llama 3.1 y vLLM · configuración de KV cache. Verificadas el 21-08-2026.