论文

AgentGym2:在去理想化真实环境中基准测试LLM智能体

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

智能体系统模型训练强化学习Agent任务评测Agentic RL

摘要

语言智能体进步迅速并日益部署到生产环境,凸显对严格现实评估的迫切需求。但既有基准多在简化理想化的设定中评估:依赖预打包工具接口、忽略关键步骤、假设输入干净且完全指定——低估真实部署的难度,其中不确定与噪声无处不在、智能体必须主动探索环境以发现新工具。为弥合差距,我们提出AgentGym2:任务实例扎根于真实端到端工作需求的新评估框架。除推理与规划外,它度量智能体执行端到端流程、经探索发现工具、为未见任务组合工具、以及对嘈杂与欠指定信息保持鲁棒的能力。15个专有与开源模型的实验显示:即使Gemini与GPT-5等SOTA系统也在AgentGym2上挣扎——揭示当前智能体能力与真实应用需求之间的实质差距。

AgentGym2:在去理想化真实环境中基准测试LLM智能体:论文配图
图 1:三个维度对性能的影响:总成本、平均交互轮数和参数规模。