---
title: Explorador de leyes de escalado — parámetros, datos y cómputo
description: Explora cómo repartir cómputo entre parámetros y tokens con una superficie tipo Chinchilla, compara el óptimo y prueba la sensibilidad a sus exponentes.
hide:
  - toc
  - navigation
  - footer
---

<link rel="stylesheet" href="/stylesheets/tools.css" />
<link rel="stylesheet" href="/stylesheets/tools-scaling-laws.css" />
<script src="/assets/javascripts/tools/scaling-laws-core.js" defer></script>
<script src="/assets/javascripts/tools/scaling-laws.js" defer></script>
<script type="application/ld+json">{"@context":"https://schema.org","@type":"WebApplication","name":"Explorador de leyes de escalado — 5sigmas","url":"https://5sigmas.com/herramientas/leyes-escalado/","applicationCategory":"EducationalApplication","operatingSystem":"Any","isAccessibleForFree":true,"description":"Explorador interactivo de la asignación de cómputo entre parámetros y tokens usando una superficie de pérdida tipo Chinchilla y supuestos editables."}</script>

<div class="s5-landing s5-tool-page s5-scaling-laws" data-s5-scaling-laws data-locale="es">
<section class="s5-page-intro"><div class="s5-eyebrow">Herramientas · Escalado · 15</div><h1>Redistribuye el mismo cómputo entre parámetros y datos.</h1><p>Parte de un modelo y un volumen de entrenamiento, conserva o escala su presupuesto total y observa qué combinación minimiza la pérdida predicha por la superficie ajustada de Hoffmann et al. Puedes cambiar los exponentes para comprobar cuánto depende la conclusión del ajuste.</p></section>
<div class="s5-tool-summary-strip"><div><small>Restricción</small><strong>C ≈ 6ND</strong></div><div><small>Objetivo</small><strong>minimizar pérdida</strong></div><div><small>Modelo</small><strong>Chinchilla 2022</strong></div><div><small>Límite</small><strong>pretraining ≠ sistema completo</strong></div></div>

<div class="s5-tool-workbench">
<form class="s5-tool-controls" aria-label="Supuestos de escalado" onsubmit="return false">
<section class="s5-tool-controls__section"><h2>Escenario actual</h2><div class="s5-tool-field"><label for="s5-scaling-n-es">Parámetros <span>miles de millones</span></label><input id="s5-scaling-n-es" data-field="parametersB" type="number" min="0.001" step="1" value="70" inputmode="decimal" /><small>Número de parámetros del modelo denso.</small></div><div class="s5-tool-field"><label for="s5-scaling-d-es">Tokens de entrenamiento <span>miles de millones</span></label><input id="s5-scaling-d-es" data-field="tokensB" type="number" min="0.001" step="10" value="1400" inputmode="decimal" /><small>Tokens vistos durante pretraining.</small></div><div class="s5-tool-field"><label for="s5-scaling-c-es">Presupuesto objetivo <span>× presupuesto actual</span></label><input id="s5-scaling-c-es" data-field="budgetMultiplier" type="number" min="0.01" max="1000" step="0.1" value="1" inputmode="decimal" /><small>1× conserva el mismo FLOP total; 10× multiplica el producto N·D por diez.</small></div></section>
<details><summary>Sensibilidad del ajuste</summary><section class="s5-tool-controls__section"><div class="s5-tool-field"><label for="s5-scaling-alpha-es">Exponente de parámetros α</label><input id="s5-scaling-alpha-es" data-field="alpha" type="number" min="0.01" max="2" step="0.01" value="0.34" inputmode="decimal" /></div><div class="s5-tool-field"><label for="s5-scaling-beta-es">Exponente de datos β</label><input id="s5-scaling-beta-es" data-field="beta" type="number" min="0.01" max="2" step="0.01" value="0.28" inputmode="decimal" /></div><small>Los coeficientes E, A y B permanecen en el ajuste publicado de Hoffmann et al. Cambiar α o β crea un contrafactual pedagógico, no un nuevo ajuste empírico.</small></section></details>
<section class="s5-tool-controls__section"><div class="s5-tool-actions"><button class="s5-tool-action" type="button" data-action="share">Copiar escenario</button><button class="s5-tool-action" type="button" data-action="json">Exportar JSON</button><button class="s5-tool-action" type="button" data-action="reset">Restablecer</button></div><p class="s5-tool-feedback" data-s5-tool-feedback hidden aria-live="polite"></p></section>
</form>

<section class="s5-tool-results">
<div class="s5-section-head s5-section-head--with-copy"><div><div class="s5-eyebrow">Presupuesto fijo</div><h2>Qué cambia cuando N y D compiten por el mismo cómputo</h2></div><p data-output="interpretation">—</p></div>
<div class="s5-scaling-kpis"><div><small>Cómputo actual</small><strong data-output="current-compute">—</strong><span>aproximación densa 6ND</span></div><div><small>Cómputo objetivo</small><strong data-output="target-compute">—</strong><span>después del multiplicador</span></div><div><small>Parámetros óptimos</small><strong data-output="optimal-params">—</strong><span>para esta superficie</span></div><div><small>Tokens óptimos</small><strong data-output="optimal-tokens">—</strong><span>para esta superficie</span></div></div>
<section class="s5-scaling-card"><div class="s5-scaling-chart" data-output="chart" role="region" aria-label="Curva de pérdida bajo presupuesto de cómputo fijo" tabindex="0"></div></section>
<div class="s5-scaling-interpretation"><section><h3>Asignación</h3><p>Pérdida con la misma proporción N:D: <strong data-output="same-ratio-loss">—</strong></p><p>Pérdida en el óptimo: <strong data-output="optimal-loss">—</strong></p><p>Diferencia atribuible a la asignación dentro de este modelo: <strong data-output="loss-gap">—</strong></p><p>Tokens por parámetro: <strong data-output="current-ratio">—</strong> actual · <strong data-output="optimal-ratio">—</strong> en el óptimo.</p></section><section><h3>Cómo escala el óptimo</h3><p>N<sub>opt</sub> ∝ C<sup><span data-output="parameter-exponent">—</span></sup></p><p>D<sub>opt</sub> ∝ C<sup><span data-output="token-exponent">—</span></sup></p><p class="s5-scaling-formula" data-output="fit">—</p></section></div>
</section></div>

<section class="s5-section"><div class="s5-section-head"><div><div class="s5-eyebrow">Método</div><h2>El óptimo es matemático dentro de una superficie empírica concreta.</h2></div></div><div class="s5-scaling-method"><div><strong>Pérdida separada en dos cuellos de botella</strong><p>Se usa L(N,D)=E+A/N<sup>α</sup>+B/D<sup>β</sup>. Aumentar parámetros reduce un término; aumentar datos reduce el otro.</p></div><div><strong>Cómputo como producto</strong><p>La aproximación C≈6ND convierte un presupuesto fijo en una restricción: si N crece, D debe caer para conservar el mismo coste de entrenamiento.</p></div><div><strong>Derivación visible</strong><p>Con esa restricción, N<sub>opt</sub> escala como C<sup>β/(α+β)</sup> y D<sub>opt</sub> como C<sup>α/(α+β)</sup>. Los exponentes editables muestran la sensibilidad de esa conclusión.</p></div></div></section>
<section class="s5-section"><div class="s5-note-feature"><div><div class="s5-eyebrow">Qué no significa</div><h2>Esta curva no predice el rendimiento de un modelo moderno completo.</h2><p>El ajuste original estudia pérdida de pretraining en Transformers densos y un régimen experimental concreto. No incorpora post-training, MoE, calidad de datos, arquitectura, inferencia, RL, herramientas ni coste de servir el modelo. Los coeficientes mostrados son los valores redondeados publicados en el paper: el óptimo analítico calculado con ellos no tiene por qué reproducir exactamente cada tabla o frontera ajustada del estudio. Úsalo para entender el compromiso parámetros–datos y la lógica de un óptimo condicionado, no para cotizar un entrenamiento real.</p></div><div class="s5-note-feature__meta"><a href="https://arxiv.org/abs/2203.15556">Hoffmann et al. · 2022</a><br /><a href="https://arxiv.org/abs/2001.08361">Kaplan et al. · 2020</a><br />Constantes: E=1,69 · A=406,4 · B=410,7 · α=0,34 · β=0,28<br />Fuentes revisadas: 22-08-2026</div></div></section>
</div>
