Herramientas · Escalado · 15

Redistribuye el mismo cómputo entre parámetros y datos.

Parte de un modelo y un volumen de entrenamiento, conserva o escala su presupuesto total y observa qué combinación minimiza la pérdida predicha por la superficie ajustada de Hoffmann et al. Puedes cambiar los exponentes para comprobar cuánto depende la conclusión del ajuste.

RestricciónC ≈ 6ND
Objetivominimizar pérdida
ModeloChinchilla 2022
Límitepretraining ≠ sistema completo

Escenario actual

Número de parámetros del modelo denso.
Tokens vistos durante pretraining.
1× conserva el mismo FLOP total; 10× multiplica el producto N·D por diez.
Sensibilidad del ajuste
Los coeficientes E, A y B permanecen en el ajuste publicado de Hoffmann et al. Cambiar α o β crea un contrafactual pedagógico, no un nuevo ajuste empírico.
Presupuesto fijo

Qué cambia cuando N y D compiten por el mismo cómputo

Cómputo actualaproximación densa 6ND
Cómputo objetivodespués del multiplicador
Parámetros óptimospara esta superficie
Tokens óptimospara esta superficie

Asignación

Pérdida con la misma proporción N:D:

Pérdida en el óptimo:

Diferencia atribuible a la asignación dentro de este modelo:

Tokens por parámetro: actual · en el óptimo.

Cómo escala el óptimo

Nopt ∝ C

Dopt ∝ C

Método

El óptimo es matemático dentro de una superficie empírica concreta.

Pérdida separada en dos cuellos de botella

Se usa L(N,D)=E+A/Nα+B/Dβ. Aumentar parámetros reduce un término; aumentar datos reduce el otro.

Cómputo como producto

La aproximación C≈6ND convierte un presupuesto fijo en una restricción: si N crece, D debe caer para conservar el mismo coste de entrenamiento.

Derivación visible

Con esa restricción, Nopt escala como Cβ/(α+β) y Dopt como Cα/(α+β). Los exponentes editables muestran la sensibilidad de esa conclusión.

Qué no significa

Esta curva no predice el rendimiento de un modelo moderno completo.

El ajuste original estudia pérdida de pretraining en Transformers densos y un régimen experimental concreto. No incorpora post-training, MoE, calidad de datos, arquitectura, inferencia, RL, herramientas ni coste de servir el modelo. Los coeficientes mostrados son los valores redondeados publicados en el paper: el óptimo analítico calculado con ellos no tiene por qué reproducir exactamente cada tabla o frontera ajustada del estudio. Úsalo para entender el compromiso parámetros–datos y la lógica de un óptimo condicionado, no para cotizar un entrenamiento real.

Hoffmann et al. · 2022
Kaplan et al. · 2020
Constantes: E=1,69 · A=406,4 · B=410,7 · α=0,34 · β=0,28
Fuentes revisadas: 22-08-2026