Qwen
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
OCCUBENCH is a benchmark for evaluating AI agents on real-world professional tasks across 100 scenarios, 65 domains, and 10 industry categories. It uses Language Environment Simulators (LESs), where an LLM simulates domain-specific tool responses, enabling evaluation in domains without public environments. A multi-agent pipeline synthesizes 382 solvable,…
Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, et al.- Published
- Apr 2026
- Citations
- 1
- Code
- 21 stars
