Redistribuye el mismo cómputo entre parámetros y datos.
Parte de un modelo y un volumen de entrenamiento, conserva o escala su presupuesto total y observa qué combinación minimiza la pérdida predicha por la superficie ajustada de Hoffmann et al. Puedes cambiar los exponentes para comprobar cuánto depende la conclusión del ajuste.
Qué cambia cuando N y D compiten por el mismo cómputo
—
Asignación
Pérdida con la misma proporción N:D: —
Pérdida en el óptimo: —
Diferencia atribuible a la asignación dentro de este modelo: —
Tokens por parámetro: — actual · — en el óptimo.
Cómo escala el óptimo
Nopt ∝ C—
Dopt ∝ C—
—
El óptimo es matemático dentro de una superficie empírica concreta.
Se usa L(N,D)=E+A/Nα+B/Dβ. Aumentar parámetros reduce un término; aumentar datos reduce el otro.
La aproximación C≈6ND convierte un presupuesto fijo en una restricción: si N crece, D debe caer para conservar el mismo coste de entrenamiento.
Con esa restricción, Nopt escala como Cβ/(α+β) y Dopt como Cα/(α+β). Los exponentes editables muestran la sensibilidad de esa conclusión.
Esta curva no predice el rendimiento de un modelo moderno completo.
El ajuste original estudia pérdida de pretraining en Transformers densos y un régimen experimental concreto. No incorpora post-training, MoE, calidad de datos, arquitectura, inferencia, RL, herramientas ni coste de servir el modelo. Los coeficientes mostrados son los valores redondeados publicados en el paper: el óptimo analítico calculado con ellos no tiene por qué reproducir exactamente cada tabla o frontera ajustada del estudio. Úsalo para entender el compromiso parámetros–datos y la lógica de un óptimo condicionado, no para cotizar un entrenamiento real.
Para el contexto conceptual de este compromiso, consulta la guía de LLMs, incluida la explicación de por qué escalar ayuda y por qué el número de parámetros no basta.