Herramientas · Evaluación · 13

Antes de decir que un modelo gana, comprueba qué sostiene realmente el ranking.

Dos modelos pueden diferir unas décimas y, aun así, el resultado depender de la composición del benchmark, de un conjunto pequeño de ítems, de un techo casi saturado o de exposición del test durante entrenamiento. Esta herramienta mantiene esas fuentes de fragilidad separadas: no las comprime en una puntuación opaca.

Resoluciónintervalos de puntuación
Integridadítems inválidos y exposición
Composiciónsensibilidad a pesos
Límitebenchmark ≠ calidad total

Conjunto de evaluación

Se asume puntuación binaria por ítem para el intervalo descriptivo.
Preguntas rotas, ambiguas o con referencia incorrecta.
Escenario de sensibilidad; no afirma que exista contaminación real.
Explora cuánto depende el ganador de la composición elegida.

Tareas y puntuaciones

TareaPesoModelo AModelo BDiferencia
Razonamiento
Código
Conocimiento
Seguimiento de instrucciones

Los pesos se normalizan automáticamente. Interprétalos como la proporción de ítems que representa cada familia de tareas.

Modelo A
Modelo B
Diferencia observada ítems de ventaja aprox.
Ítems utilizables

Resolución y saturación

Solapamiento de intervalos 95%diagnóstico descriptivo, no test pareado
Margen hasta el 100%menos margen implica más riesgo de saturación

Con solo puntuaciones agregadas no se puede reconstruir qué ítems acertó cada modelo. Por eso no inferimos significancia pareada ni fabricamos un p-value.

Integridad del conjunto

Ítems inválidos estimados¿cubren la diferencia?
Ítems potencialmente expuestos¿cubren la diferencia?

Estas envolventes son un peor caso: preguntan si bastaría ese número de ítems para explicar la ventaja si todos favoreciesen al líder. No son evidencia de contaminación ni de puntuación defectuosa.

Sensibilidad a la composición

Rango de la diferencia al reponderarmínimo → máximo
Rankingtodos los pesos se renormalizan

El cálculo evalúa las combinaciones extremas ± del porcentaje elegido para las cuatro familias. Un cambio de ganador indica sensibilidad a qué tareas decidimos considerar más importantes.

Fragilidades activadas

No sumamos estas señales en un “índice de fiabilidad”. Saturación, contaminación, resolución y composición son problemas distintos y requieren evidencia distinta.

Método

Qué mide y qué no mide este explorador

Intervalo descriptivo

Usa un intervalo de Wilson al 95% sobre la puntuación agregada y los ítems utilizables. La aproximación supone puntuación binaria y que los pesos representan proporciones de ítems. Si las familias usan métricas distintas o ambos modelos responden a los mismos ítems, hacen falta datos por ítem y un análisis adecuado al diseño.

Sensibilidad a contaminación

Convierte la diferencia en un número aproximado de ítems y lo compara con una exposición hipotética. Es una cota de sensibilidad, no una detección de contaminación.

Benchmark lottery

Reponderar familias de tareas muestra si el ranking depende de la elección de tareas. No existe una ponderación universalmente correcta fuera del objetivo de uso.

Evaluación holística

La precisión no cubre por sí sola robustez, calibración, eficiencia, seguridad o adecuación al despliegue. La herramienta evalúa el ranking del benchmark, no la calidad total del modelo.

Fuentes

Un ranking necesita contexto estadístico y metodológico.

The Benchmark Lottery muestra que cambiar las tareas puede alterar rankings. HELM defiende cobertura amplia, múltiples métricas y transparencia sobre lo que falta. LiveBench aborda específicamente la contaminación mediante preguntas actualizadas y evaluación objetiva.