---
title: Explorador de fiabilidad de benchmarks — saturación, contaminación y ranking
description: Explora si una diferencia de benchmark queda dentro de una resolución descriptiva limitada, es sensible a ítems inválidos o exposición, está cerca del techo o depende de la ponderación de tareas.
hide:
  - toc
  - navigation
  - footer
---

<link rel="stylesheet" href="/stylesheets/tools.css" />
<link rel="stylesheet" href="/stylesheets/tools-benchmark-reliability.css" />
<script src="/assets/javascripts/tools/benchmark-reliability-core.js" defer></script>
<script src="/assets/javascripts/tools/benchmark-reliability.js" defer></script>
<script type="application/ld+json">{"@context":"https://schema.org","@type":"WebApplication","name":"Explorador de fiabilidad de benchmarks — 5sigmas","url":"https://5sigmas.com/herramientas/fiabilidad-benchmarks/","applicationCategory":"EducationalApplication","operatingSystem":"Any","isAccessibleForFree":true,"description":"Explora resolución descriptiva, saturación, exposición potencial, ítems inválidos y sensibilidad del ranking a la composición de un benchmark."}</script>

<div class="s5-landing s5-tool-page s5-benchmark" data-s5-benchmark-reliability data-locale="es">
<section class="s5-page-intro"><div class="s5-eyebrow">Herramientas · Evaluación · 13</div><h1>Antes de decir que un modelo gana, comprueba qué sostiene realmente el ranking.</h1><p>Dos modelos pueden diferir unas décimas y, aun así, el resultado depender de la composición del benchmark, de un conjunto pequeño de ítems, de un techo casi saturado o de exposición del test durante entrenamiento. Esta herramienta mantiene esas fuentes de fragilidad separadas: no las comprime en una puntuación opaca.</p></section>
<div class="s5-tool-summary-strip"><div><small>Resolución</small><strong>intervalos de puntuación</strong></div><div><small>Integridad</small><strong>ítems inválidos y exposición</strong></div><div><small>Composición</small><strong>sensibilidad a pesos</strong></div><div><small>Límite</small><strong>benchmark ≠ calidad total</strong></div></div>

<div class="s5-tool-workbench">
<form class="s5-tool-controls" aria-label="Supuestos del benchmark" onsubmit="return false">
<section class="s5-tool-controls__section"><h2>Conjunto de evaluación</h2><div class="s5-tool-field-grid"><div class="s5-tool-field"><label for="s5-bench-items-es">Ítems totales</label><input id="s5-bench-items-es" data-field="items" type="number" min="20" max="10000000" step="10" value="1000" /><small>Se asume puntuación binaria por ítem para el intervalo descriptivo.</small></div><div class="s5-tool-field"><label for="s5-bench-invalid-es">Ítems inválidos (%)</label><input id="s5-bench-invalid-es" data-field="invalidRate" type="number" min="0" max="95" step="0.1" value="2" /><small>Preguntas rotas, ambiguas o con referencia incorrecta.</small></div><div class="s5-tool-field"><label for="s5-bench-contam-es">Exposición potencial del test (%)</label><input id="s5-bench-contam-es" data-field="contaminationExposure" type="number" min="0" max="100" step="0.1" value="5" /><small>Escenario de sensibilidad; no afirma que exista contaminación real.</small></div><div class="s5-tool-field"><label for="s5-bench-swing-es">Variación máxima de peso por tarea (%)</label><input id="s5-bench-swing-es" data-field="weightSwing" type="number" min="0" max="100" step="1" value="30" /><small>Explora cuánto depende el ganador de la composición elegida.</small></div></div></section>
<section class="s5-tool-controls__section"><h2>Tareas y puntuaciones</h2><div class="s5-benchmark-table-scroll" role="region" aria-label="Tabla editable de tareas y puntuaciones" tabindex="0"><table class="s5-benchmark-table"><thead><tr><th>Tarea</th><th>Peso</th><th>Modelo A</th><th>Modelo B</th><th>Diferencia</th></tr></thead><tbody><tr data-group-row><td>Razonamiento</td><td><input aria-label="Peso de razonamiento" data-field="w0" type="number" min="0.01" max="100" step="0.1" value="25" /></td><td><input aria-label="Puntuación A en razonamiento" data-field="a0" type="number" min="0" max="100" step="0.1" value="82" /></td><td><input aria-label="Puntuación B en razonamiento" data-field="b0" type="number" min="0" max="100" step="0.1" value="80" /></td><td><span data-group-gap>—</span><small data-group-share>—</small></td></tr><tr data-group-row><td>Código</td><td><input aria-label="Peso de código" data-field="w1" type="number" min="0.01" max="100" step="0.1" value="25" /></td><td><input aria-label="Puntuación A en código" data-field="a1" type="number" min="0" max="100" step="0.1" value="74" /></td><td><input aria-label="Puntuación B en código" data-field="b1" type="number" min="0" max="100" step="0.1" value="78" /></td><td><span data-group-gap>—</span><small data-group-share>—</small></td></tr><tr data-group-row><td>Conocimiento</td><td><input aria-label="Peso de conocimiento" data-field="w2" type="number" min="0.01" max="100" step="0.1" value="25" /></td><td><input aria-label="Puntuación A en conocimiento" data-field="a2" type="number" min="0" max="100" step="0.1" value="86" /></td><td><input aria-label="Puntuación B en conocimiento" data-field="b2" type="number" min="0" max="100" step="0.1" value="84" /></td><td><span data-group-gap>—</span><small data-group-share>—</small></td></tr><tr data-group-row><td>Seguimiento de instrucciones</td><td><input aria-label="Peso de seguimiento de instrucciones" data-field="w3" type="number" min="0.01" max="100" step="0.1" value="25" /></td><td><input aria-label="Puntuación A en seguimiento de instrucciones" data-field="a3" type="number" min="0" max="100" step="0.1" value="79" /></td><td><input aria-label="Puntuación B en seguimiento de instrucciones" data-field="b3" type="number" min="0" max="100" step="0.1" value="78" /></td><td><span data-group-gap>—</span><small data-group-share>—</small></td></tr></tbody></table></div><p class="s5-benchmark-note">Los pesos se normalizan automáticamente. Interprétalos como la proporción de ítems que representa cada familia de tareas.</p><div class="s5-tool-actions"><button class="s5-tool-action" type="button" data-action="share">Copiar escenario</button><button class="s5-tool-action" type="button" data-action="export">Exportar JSON</button><button class="s5-tool-action" type="button" data-action="reset">Restablecer</button></div><p class="s5-tool-feedback" data-s5-tool-feedback hidden aria-live="polite"></p></section>
</form>

<section class="s5-tool-results">
<p class="s5-benchmark-interpretation" data-output="interpretation" aria-live="polite">—</p>
<div class="s5-benchmark-kpis"><div><small>Modelo A</small><strong data-output="scoreA">—</strong><span data-output="intervalA">—</span></div><div><small>Modelo B</small><strong data-output="scoreB">—</strong><span data-output="intervalB">—</span></div><div><small>Diferencia observada</small><strong data-output="gap">—</strong><span><span data-output="gapItems">—</span> ítems de ventaja aprox.</span></div><div><small>Ítems utilizables</small><strong data-output="cleanItems">—</strong><span data-output="resolution">—</span></div></div>
<div class="s5-benchmark-grid"><section class="s5-benchmark-panel"><h3>Resolución y saturación</h3><div class="s5-benchmark-pairs"><div class="s5-benchmark-pair"><small>Solapamiento de intervalos 95%</small><strong data-output="resolution">—</strong><span>diagnóstico descriptivo, no test pareado</span></div><div class="s5-benchmark-pair"><small>Margen hasta el 100%</small><strong data-output="headroom">—</strong><span>menos margen implica más riesgo de saturación</span></div></div><p class="s5-benchmark-note">Con solo puntuaciones agregadas no se puede reconstruir qué ítems acertó cada modelo. Por eso no inferimos significancia pareada ni fabricamos un p-value.</p></section><section class="s5-benchmark-panel"><h3>Integridad del conjunto</h3><div class="s5-benchmark-pairs"><div class="s5-benchmark-pair"><small>Ítems inválidos estimados</small><strong data-output="invalidItems">—</strong><span>¿cubren la diferencia? <span data-output="invalidEnvelope">—</span></span></div><div class="s5-benchmark-pair"><small>Ítems potencialmente expuestos</small><strong data-output="exposureItems">—</strong><span>¿cubren la diferencia? <span data-output="contaminationEnvelope">—</span></span></div></div><p class="s5-benchmark-note">Estas envolventes son un peor caso: preguntan si bastaría ese número de ítems para explicar la ventaja si todos favoreciesen al líder. No son evidencia de contaminación ni de puntuación defectuosa.</p></section><section class="s5-benchmark-panel"><h3>Sensibilidad a la composición</h3><div class="s5-benchmark-pairs"><div class="s5-benchmark-pair"><small>Rango de la diferencia al reponderar</small><strong data-output="weightRange">—</strong><span>mínimo → máximo</span></div><div class="s5-benchmark-pair"><small>Ranking</small><strong data-output="weightStatus">—</strong><span>todos los pesos se renormalizan</span></div></div><p class="s5-benchmark-note">El cálculo evalúa las combinaciones extremas ± del porcentaje elegido para las cuatro familias. Un cambio de ganador indica sensibilidad a qué tareas decidimos considerar más importantes.</p></section><section class="s5-benchmark-panel"><h3>Fragilidades activadas</h3><div class="s5-benchmark-flags" data-output="flags"></div><p class="s5-benchmark-note">No sumamos estas señales en un “índice de fiabilidad”. Saturación, contaminación, resolución y composición son problemas distintos y requieren evidencia distinta.</p></section></div>
</section></div>

<section class="s5-section"><div class="s5-section-head"><div><div class="s5-eyebrow">Método</div><h2>Qué mide y qué no mide este explorador</h2></div></div><div class="s5-benchmark-method"><div><strong>Intervalo descriptivo</strong><p>Usa un intervalo de Wilson al 95% sobre la puntuación agregada y los ítems utilizables. La aproximación supone puntuación binaria y que los pesos representan proporciones de ítems. Si las familias usan métricas distintas o ambos modelos responden a los mismos ítems, hacen falta datos por ítem y un análisis adecuado al diseño.</p></div><div><strong>Sensibilidad a contaminación</strong><p>Convierte la diferencia en un número aproximado de ítems y lo compara con una exposición hipotética. Es una cota de sensibilidad, no una detección de contaminación.</p></div><div><strong>Benchmark lottery</strong><p>Reponderar familias de tareas muestra si el ranking depende de la elección de tareas. No existe una ponderación universalmente correcta fuera del objetivo de uso.</p></div><div><strong>Evaluación holística</strong><p>La precisión no cubre por sí sola robustez, calibración, eficiencia, seguridad o adecuación al despliegue. La herramienta evalúa el ranking del benchmark, no la calidad total del modelo.</p></div></div></section>
<section class="s5-section"><div class="s5-note-feature"><div><div class="s5-eyebrow">Fuentes</div><h2>Un ranking necesita contexto estadístico y metodológico.</h2><p>The Benchmark Lottery muestra que cambiar las tareas puede alterar rankings. HELM defiende cobertura amplia, múltiples métricas y transparencia sobre lo que falta. LiveBench aborda específicamente la contaminación mediante preguntas actualizadas y evaluación objetiva.</p></div><div class="s5-note-feature__meta"><a href="https://arxiv.org/abs/2107.07002">Dehghani et al. · The Benchmark Lottery</a><br /><a href="https://crfm.stanford.edu/2022/11/17/helm.html">Stanford CRFM · HELM</a><br /><a href="https://arxiv.org/abs/2406.19314">LiveBench · Contamination-Free Benchmark</a><br />Revisado: 21-08-2026</div></div></section>
</div>
