Herramientas · Datos · 14

Sigue una capacidad sin mezclar benchmarks distintos en una sola serie.

Selecciona una evaluación y recorre los resultados reportados por fecha. Cada punto conserva modelo, condiciones y fuente. Si cambia el protocolo, la visualización marca la discontinuidad.

Tiempofecha de lanzamiento
Mediciónuna evaluación cada vez
Procedenciafuente por punto
Límitebenchmark ≠ capacidad total

Serie

No se normalizan ni promedian benchmarks diferentes.
Serie seleccionada

Cargando…

—

Último resultado reportado——
Cambio desde el primer punto—descriptivo, no causal
Ventana temporal—entre primer y último punto
Protocolo——

Cómo leer la serie

—

La pendiente resume resultados publicados. No separa mejora del modelo, cambios de prompt, esfuerzo de razonamiento, harness o condiciones de evaluación.

Fuentes activas

    FechaModeloResultadoProtocoloCondicionesFuente
    Método

    La serie conserva protocolo, condiciones y fuente de cada resultado.

    Una métrica por serie

    GPQA Diamond, MMMU-Pro, SWE-bench Verified, SWE-Bench Pro, Toolathlon y ARC-AGI-2 se muestran por separado. No se convierten a un índice común.

    Versiones y protocolos visibles

    Cuando una fuente cambia número de problemas, harness o versión, la serie conserva ese contexto. SWE-bench Verified muestra dos resultados distintos de GPT-5 bajo protocolos diferentes.

    Procedencia por punto

    Cada observación enlaza a la tabla de lanzamiento que publicó el valor y conserva las condiciones reportadas. El dataset se revisa con nuevos lanzamientos y al menos cada 30 días mientras esté activo.

    Contexto relacionado

    Una curva de benchmark describe evidencia, no define por sí sola qué es un LLM.

    Para interpretar estas series junto a arquitectura, tokens, entrenamiento e inferencia, consulta qué es un LLM y cómo funciona. Mantener ambos niveles separados evita convertir un benchmark concreto en una definición general de capacidad.

    Alcance de la primera versión

    Las comparaciones solo se incluyen cuando las condiciones están documentadas.

    Esta versión usa tablas de lanzamiento de OpenAI porque permiten encadenar varias generaciones con condiciones de evaluación documentadas. No coloca resultados de otros proveedores en la misma línea si no se puede justificar que la configuración sea comparable. El dataset puede añadirlos como series o protocolos separados cuando exista evidencia suficiente. GPT-6 Astra se incorpora solo en GPQA Diamond, donde OpenAI publica un valor directamente comparable. GPT-6 Sol/Luna, GPT-6.1 Sol, Claude Sonnet 5.5 y Gemini 4 Argon quedan registrados como revisados pero no añadidos cuando sus tablas o protocolos no son directamente compatibles con las series existentes.