Herramientas · Agentes · 11

Evalúa si un agente resuelve la tarea y si su trayectoria es fiable.

Un resultado correcto puede esconder una llamada a herramienta incorrecta, demasiados reintentos o un camino frágil. El playground separa el resultado final, las decisiones observables de la traza y los fallos operativos, y los compara con criterios de publicación que tú defines.

Resultadoéxito final, primer intento y recuperación
Trazaherramientas correctas, omisiones, pasos y reintentos
Operacióntimeouts, política y proyección

Resultado por tarea

Herramientas y trayectoria

El resto se interpreta como una decisión requerida que el agente omitió.

Operación y tráfico

Puede solaparse con otros fallos; no se suma a la tasa de fallo.
No cuentes bloqueos correctos de los guardrails como incumplimientos.

Criterios de publicación

Los criterios comparan estimaciones puntuales. Los intervalos del 95% se muestran por separado y no se usan para aprobar automáticamente una versión.

Éxito final
Primer intentosin reintento
Decisiones de herramienta correctas
Recuperación tras reintentosobre tareas reintentadas
Timeouts
Política
Herramienta omitida
Pasos innecesarios
Pasos por tarea
Multiplicador de intentos
No agregamosfallos ≠ suma de incidencias
Unidadtarea + traza observable

Criterios de publicación

Éxito final
Primer intento
Decisión de herramienta
Timeouts
Política
Pasos innecesarios

Timeouts esperados
Incumplimientos esperados

Límite: la proyección supone una distribución futura similar a la muestra evaluada. El rango de fallos procede del intervalo Wilson del éxito final; no modela cambios en la distribución de datos ni dependencia entre tareas.

Resultado y trayectoria responden preguntas distintas

Estado final

τ-bench evalúa el estado final del entorno frente a un objetivo anotado.

Traza observable

La elección de herramienta, sus argumentos, los reintentos, los handoffs y los pasos ayudan a localizar la causa del resultado. OpenAI denomina trace grading a esta evaluación estructurada de la trayectoria.

Consistencia

Para medir consistencia necesitas repetir varias veces la misma tarea. No reconstruimos pass^k a partir de una única tasa de éxito.

Fuentes

Sin score compuesto oculto.

Los criterios son configurables y no se presentan como umbrales universales.