Sigue una capacidad sin mezclar benchmarks distintos en una sola serie.
Selecciona una evaluación y recorre los resultados reportados por fecha. Cada punto conserva modelo, condiciones y fuente. Si cambia el protocolo, la visualización marca la discontinuidad.
Cargando…
—
Cómo leer la serie
—
La pendiente resume resultados publicados. No separa mejora del modelo, cambios de prompt, esfuerzo de razonamiento, harness o condiciones de evaluación.
Fuentes activas
| Fecha | Modelo | Resultado | Protocolo | Condiciones | Fuente |
|---|
La serie conserva protocolo, condiciones y fuente de cada resultado.
GPQA Diamond, MMMU-Pro, SWE-bench Verified, SWE-Bench Pro, Toolathlon y ARC-AGI-2 se muestran por separado. No se convierten a un índice común.
Cuando una fuente cambia número de problemas, harness o versión, la serie conserva ese contexto. SWE-bench Verified muestra dos resultados distintos de GPT-5 bajo protocolos diferentes.
Cada observación enlaza a la tabla de lanzamiento que publicó el valor y conserva las condiciones reportadas. El dataset se revisa con nuevos lanzamientos y al menos cada 30 días mientras esté activo.
Las comparaciones solo se incluyen cuando las condiciones están documentadas.
Esta versión usa tablas de lanzamiento de OpenAI porque permiten encadenar varias generaciones con condiciones de evaluación documentadas. No coloca resultados de otros proveedores en la misma línea si no se puede justificar que la configuración sea comparable. El dataset puede añadirlos como series o protocolos separados cuando exista evidencia suficiente.