Redistribuye el mismo cómputo entre parámetros y datos.
Parte de un modelo y un volumen de entrenamiento, conserva o escala su presupuesto total y observa qué combinación minimiza la pérdida predicha por la superficie ajustada de Hoffmann et al. Puedes cambiar los exponentes para comprobar cuánto depende la conclusión del ajuste.
Qué cambia cuando N y D compiten por el mismo cómputo
—
Asignación
Pérdida con la misma proporción N:D: —
Pérdida en el óptimo: —
Diferencia atribuible a la asignación dentro de este modelo: —
Tokens por parámetro: — actual · — en el óptimo.
Cómo escala el óptimo
Nopt ∝ C—
Dopt ∝ C—
—
El óptimo es matemático dentro de una superficie empírica concreta.
Se usa L(N,D)=E+A/Nα+B/Dβ. Aumentar parámetros reduce un término; aumentar datos reduce el otro.
La aproximación C≈6ND convierte un presupuesto fijo en una restricción: si N crece, D debe caer para conservar el mismo coste de entrenamiento.
Con esa restricción, Nopt escala como Cβ/(α+β) y Dopt como Cα/(α+β). Los exponentes editables muestran la sensibilidad de esa conclusión.
Esta curva no predice el rendimiento de un modelo moderno completo.
El ajuste original estudia pérdida de pretraining en Transformers densos y un régimen experimental concreto. No incorpora post-training, MoE, calidad de datos, arquitectura, inferencia, RL, herramientas ni coste de servir el modelo. Los coeficientes mostrados son los valores redondeados publicados en el paper: el óptimo analítico calculado con ellos no tiene por qué reproducir exactamente cada tabla o frontera ajustada del estudio. Úsalo para entender el compromiso parámetros–datos y la lógica de un óptimo condicionado, no para cotizar un entrenamiento real.