Herramientas · Infraestructura · 17

Encuentra qué limita la capacidad real de un datacenter de IA.

Define la potencia total de la instalación, el PUE, los racks, la densidad y la refrigeración. El explorador calcula cuántos aceleradores pueden estar activos y mantiene separado el límite físico del rendimiento de entrenamiento y del throughput de inferencia.

InstalaciónMW totales → IT
Rackpotencia + refrigeración
Entrenamientopico × MFU
Inferenciasolo desde medición

Instalación

Incluye IT y soporte de instalación. El presupuesto IT se deriva con el PUE representativo.
PUE es una razón energética; usarla aquí sobre potencia supone que representa este punto de operación.
Margen que no se asigna a la carga calculada.

Racks

Usa el límite térmico efectivo del rack o del sistema de refrigeración que lo sirve.

Hardware y cómputo

CPU, memoria, red y almacenamiento aproximados por acelerador.

Mapa opcional a inferencia

0 desactiva la estimación. Introduce una medición de tu modelo, runtime, batch y SLO; no se infiere desde FLOPs.
Supuestos avanzados del acelerador
Resultado

La capacidad es el mínimo entre límites independientes.

Aceleradores activosmáximo simultáneo
Cuello de botellalímite que gana
Potencia de instalacióncon PUE aplicado
Cómputo de entrenamientopico denso × MFU

Cuatro límites sobre la misma flota

Cada barra muestra cuántos aceleradores admitiría ese límite por separado. El número publicable es el menor. Así no se confunde potencia disponible con espacio físico o refrigeración suficiente.

Instalación

Capacidad IT utilizable:

Reserva IT:

Margen de potencia total:

Uso de la envolvente total:

Rack

Máximo activo por rack:

Carga IT a ese máximo:

Margen eléctrico por rack:

Margen térmico por rack:

Entrenamiento

Pico BF16 denso de la flota activa:

Cómputo sostenido con MFU:

Cómputo sostenido por día:

Densidad física

Slots instalados realmente utilizables:

Una baja utilización aquí no implica mala eficiencia: puede indicar que potencia o refrigeración limitan antes que el espacio físico.

Inferencia: usa una medición de serving, no el pico de FLOPs

Throughput agregado
Finalizaciones aproximadas
Método

Separa instalación, rack y servicio.

1 · Instalación

La potencia total se divide por un PUE representativo para aproximar la capacidad IT. Después se retira la reserva operativa.

2 · Rack

Cada acelerador suma potencia media y resto de IT. Ese footprint se contrasta por separado con slots instalados, límite eléctrico y capacidad térmica del rack.

3 · Cómputo y serving

Entrenamiento usa pico BF16 denso × MFU. Inferencia solo se calcula cuando introduces throughput sostenido medido en tu stack; no se transforma FLOPs en tokens/s.

Límites

Es un modelo de capacidad, no un diseño MEP ni un benchmark de serving.

PUE es una razón energética y puede cambiar con carga y clima. TDP no equivale a consumo medio. La aproximación del resto de IT es lineal aunque CPU, red y almacenamiento no escalen siempre así. La capacidad térmica debe venir del diseño real del rack y su sistema de refrigeración. MFU depende del workload y del software. El throughput de inferencia depende del modelo, precisión, contexto, batching, runtime y SLO; por eso esta herramienta solo lo agrega cuando aportas una medición por acelerador.

Comparar con el estimador de cómputo y energía de entrenamiento →