论文
AlgoWorlds:算法世界中全局优化的基准测试工具
AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds
摘要
工具使用基准通常评估代理是否使用适当的工具和有效的参数完成工作流程。然而,在航线规划和车队调度等现实决策环境中,仅靠可行性是不够的。个人选择通过共同的约束和成本相互作用,因此可行的解决方案可能仍然不是最优的。这就提出了一个更难的问题:智能体能否将通过工具收集的信息转化为全局最优决策?我们引入了 AlgoWorlds,这是一个基准,它将正式指定的组合优化问题转换为具有可验证的全局最优值的部分观察的决策环境。每个环境都包含一个只能通过特定于任务的信息工具观察到的隐藏实例,之后代理会做出一个评估可行性和最优性的结构化决策。 AlgoWorlds 包含 240 个环境,涵盖 10 个组合优化系列和四个工作负载级别。特定系列的确定性程序生成实例,精确的算法证明其最佳状态并确定工作负载水平,两个结构不同的工具界面呈现每个底层实例。我们评估了七个领先的 LLM,包括 Claude Opus 4.8 和 GPT-5.6 Sol。实现全局最优仍然极具挑战性:尽管领先模型在大多数情况下都能产生可行的决策,但表现最佳的模型仅在 38.61% 的情况下达到精确最优。即使代理收集了足够的信息来重建隐藏的实例,大多数失败也会以可行但次优的决策而告终。因此,挑战不仅限于信息获取,还扩展到信息集成、全局约束推理和决策验证。项目主页位于https://xzx34.github.io/AlgoWorlds/,代码位于https://github.com/xzx34/AlgoWorlds。