AgentBench (2023)
Evaluated agents across 8 interactive environments, revealing a large gap between open and proprietary agents — agentic competence, not API syntax.
Evaluated agents across 8 interactive environments, revealing a large gap between open and proprietary agents — agentic competence, not API syntax.