Evalúa si un agente resuelve la tarea y si su trayectoria es fiable.
Un resultado correcto puede esconder una llamada a herramienta incorrecta, demasiados reintentos o un camino frágil. El playground separa el resultado final, las decisiones observables de la traza y los fallos operativos, y los compara con criterios de publicación que tú defines.
Criterios de publicación
——
Límite: la proyección supone una distribución futura similar a la muestra evaluada. El rango de fallos procede del intervalo Wilson del éxito final; no modela cambios en la distribución de datos ni dependencia entre tareas.
Resultado y trayectoria responden preguntas distintas
τ-bench evalúa el estado final del entorno frente a un objetivo anotado.
La elección de herramienta, sus argumentos, los reintentos, los handoffs y los pasos ayudan a localizar la causa del resultado. OpenAI denomina trace grading a esta evaluación estructurada de la trayectoria.
Para medir consistencia necesitas repetir varias veces la misma tarea. No reconstruimos pass^k a partir de una única tasa de éxito.
Conecta la traza con el sistema de evaluación
Estas métricas de fiabilidad son una capa de un sistema de evaluación más amplio. El marco de evaluación de modelos y sistemas de IA explica cómo combinar criterios deterministas, conjuntos de referencia, evaluación humana y señales de producción sin reducir la calidad a un único score.
Sin score compuesto oculto.
Los criterios son configurables y no se presentan como umbrales universales.