AgentBench (2023)

Evaluated agents across 8 interactive environments, revealing a large gap between open and proprietary agents — agentic competence, not API syntax.