Evalúa si un agente resuelve la tarea y si su trayectoria es fiable.
Un resultado correcto puede esconder una llamada a herramienta incorrecta, demasiados reintentos o un camino frágil. El playground separa el resultado final, las decisiones observables de la traza y los fallos operativos, y los compara con criterios de publicación que tú defines.
Criterios de publicación
——
Límite: la proyección supone una distribución futura similar a la muestra evaluada. El rango de fallos procede del intervalo Wilson del éxito final; no modela cambios en la distribución de datos ni dependencia entre tareas.
Resultado y trayectoria responden preguntas distintas
τ-bench evalúa el estado final del entorno frente a un objetivo anotado.
La elección de herramienta, sus argumentos, los reintentos, los handoffs y los pasos ayudan a localizar la causa del resultado. OpenAI denomina trace grading a esta evaluación estructurada de la trayectoria.
Para medir consistencia necesitas repetir varias veces la misma tarea. No reconstruimos pass^k a partir de una única tasa de éxito.
Sin score compuesto oculto.
Los criterios son configurables y no se presentan como umbrales universales.