Antes de decir que un modelo gana, comprueba qué sostiene realmente el ranking.
Dos modelos pueden diferir unas décimas y, aun así, el resultado depender de la composición del benchmark, de un conjunto pequeño de ítems, de un techo casi saturado o de exposición del test durante entrenamiento. Esta herramienta mantiene esas fuentes de fragilidad separadas: no las comprime en una puntuación opaca.
—
Resolución y saturación
Con solo puntuaciones agregadas no se puede reconstruir qué ítems acertó cada modelo. Por eso no inferimos significancia pareada ni fabricamos un p-value.
Integridad del conjunto
Estas envolventes son un peor caso: preguntan si bastaría ese número de ítems para explicar la ventaja si todos favoreciesen al líder. No son evidencia de contaminación ni de puntuación defectuosa.
Sensibilidad a la composición
El cálculo evalúa las combinaciones extremas ± del porcentaje elegido para las cuatro familias. Un cambio de ganador indica sensibilidad a qué tareas decidimos considerar más importantes.
Fragilidades activadas
No sumamos estas señales en un “índice de fiabilidad”. Saturación, contaminación, resolución y composición son problemas distintos y requieren evidencia distinta.
Qué mide y qué no mide este explorador
Usa un intervalo de Wilson al 95% sobre la puntuación agregada y los ítems utilizables. La aproximación supone puntuación binaria y que los pesos representan proporciones de ítems. Si las familias usan métricas distintas o ambos modelos responden a los mismos ítems, hacen falta datos por ítem y un análisis adecuado al diseño.
Convierte la diferencia en un número aproximado de ítems y lo compara con una exposición hipotética. Es una cota de sensibilidad, no una detección de contaminación.
Reponderar familias de tareas muestra si el ranking depende de la elección de tareas. No existe una ponderación universalmente correcta fuera del objetivo de uso.
La precisión no cubre por sí sola robustez, calibración, eficiencia, seguridad o adecuación al despliegue. La herramienta evalúa el ranking del benchmark, no la calidad total del modelo.
Un ranking necesita contexto estadístico y metodológico.
The Benchmark Lottery muestra que cambiar las tareas puede alterar rankings. HELM defiende cobertura amplia, múltiples métricas y transparencia sobre lo que falta. LiveBench aborda específicamente la contaminación mediante preguntas actualizadas y evaluación objetiva.