论文

语言模型智能体的探索与利用误差是可测量的

Exploration and Exploitation Errors Are Measurable for Language Model Agents

智能体系统Agent任务评测

摘要

语言模型(LM)智能体正被越来越多地用于复杂的开放式决策任务,从AI编程到物理AI。在这些场景中,一个核心要求是既能探索问题空间又能有效利用已获知识。然而,在无法访问智能体内部策略的情况下,从观测到的动作中系统地区分并量化探索与利用仍然具有挑战性。为解决这一问题,我们设计了受实际具身AI场景启发的可控环境。每个环境由一个部分可观测的2D网格地图和一个未知的任务有向无环图(DAG)组成。地图生成可通过编程调整,以侧重探索或利用难度。为实现与策略无关的评估,我们设计了一个从智能体动作量化探索与利用误差的指标。我们评估了多种前沿LM智能体,发现即使最先进的模型也难以胜任该任务,且不同模型表现出不同的失败模式。我们进一步观察到推理模型能更有效地解决该任务,并表明探索与利用均可通过最小化的harness工程得到显著改善。我们已在 https://github.com/jjj-madison/measurable-explore-exploit 发布代码。

语言模型智能体的探索与利用误差是可测量的:论文配图
(a) 成功率与探索错误 (b) 成功率与利用错误 图 1:不同 LM 的成功率与探索/利用错误之间的总体关系。在图1(a)中,log\log探索错误和成功率表现出很强的负线性关系(R2=0.947R^{2}=0.947),而图1(b)描绘了log\log探索错误和成功率之间的弱关系(R2=0.006R^{2}=0.006)。这意味着更有效地探索环境的 LM 智能体将有机会实现目标任务。