论文
OccuBench:通过语言环境模拟评估人工智能代理在现实世界专业任务中的表现
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
摘要
人工智能代理预计将在数百个职业领域(从急诊室分诊到核反应堆安全监测到海关进口处理)执行专业工作,但现有基准只能评估公共环境存在的少数领域的代理。我们推出了 OccuBench,这是一个涵盖 10 个行业类别和 65 个专业领域的 100 个真实专业任务场景的基准测试,由语言环境模拟器 (LES) 启用,该模拟器通过 LLM 驱动的工具响应生成来模拟特定于域的环境。我们的多智能体合成管道自动生成具有保证可解性、校准难度和基于文档的多样性的评估实例。 OccuBench 从两个互补的维度评估代理:跨专业领域的任务完成情况和受控故障注入(显式错误、隐式数据降级和混合故障)下的环境鲁棒性。我们评估了 8 个模型系列中的 15 个前沿模型,发现:(1)没有一个模型能够主导所有行业,因为每个模型都有不同的职业能力特征; (2) 隐式错误(截断数据、丢失字段)比显式错误(超时、500 秒)和混合错误更难,因为它们缺乏明显的错误信号,并且需要代理独立检测数据降级; (3) 更大的模型、更新的世代和更高的推理能力不断提高性能。 GPT-5.2 从最小推理到最大推理工作提高了 27.5 分; (4)强代理不一定是强环境模拟器。模拟器质量对于基于 LES 的评估可靠性至关重要。 OccuBench 首次对 AI 代理在专业职业任务上进行系统性跨行业评估。