Atlas · GenAI 2026

Agent Evaluation

Measuring agent trajectories, tool-use correctness and task success (τ-bench, WebArena, SWE-bench) — beyond single-turn output scoring.

conceptPeak: 2025Evaluation DesignAI consensus: 0/3

Prerequisites

Recommended reference

τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains — arXiv 2406.12045

Notes from AI deep research