Convierte un plan de entrenamiento en cómputo, tiempo y energía.
Define el clúster, la utilización real del cómputo, la potencia media y la eficiencia de la instalación. Después compáralos con una carga aproximada de preentrenamiento denso. Todos los supuestos que más cambian el resultado son editables.
Separa el cómputo entregado de la energía consumida.
—
De la potencia IT a la energía de instalación
La barra separa aceleradores, resto de IT y el sobrecoste energético que refleja el PUE. El TDP no se trata como consumo medido: la fracción de potencia media se controla arriba.
Potencia y energía
Potencia media de instalación: —
Energía durante la ventana programada: —
Energía para completar la carga aproximada: —
Rendimiento efectivo
FLOPs de modelo sostenidos: —
FLOPs de modelo por MW de instalación: —
MFU y potencia media son variables distintas: un clúster puede consumir mucha potencia y aun así convertir una fracción pequeña del pico teórico en FLOPs útiles del modelo.
Tres capas, sin mezclarlas.
La carga usa C≈kND, con k=6 por defecto. Es una aproximación para preentrenamiento denso, no una medición exacta de cualquier arquitectura.
El rendimiento útil se estima como aceleradores × pico denso × MFU. El MFU es editable porque depende de arquitectura, paralelismo, secuencia, software y escala.
La potencia de aceleradores usa TDP × fracción media. Después se añade el resto de IT y finalmente PUE para pasar de energía IT a energía total de instalación.
Es un estimador de ingeniería, no una factura eléctrica ni una medición de carbono.
TDP es un límite de diseño configurable, no una lectura de potencia. MFU no es utilización eléctrica. PUE es una métrica de instalación y puede variar con carga y clima. La aproximación 6ND omite detalles de atención, vocabulario, MoE, recomputación y otras decisiones de entrenamiento. El cálculo tampoco convierte energía en emisiones: para eso haría falta una intensidad de carbono temporal y regional fiable.