论文

行动前先问世界:校准智能体世界模型的环境探查

Ask the World Before Acting: Environment Probing for Calibrated Agent World Models

智能体系统Agent 环境交互

摘要

长期行动的语言代理必须保持对工具状态、对象位置、图边缘和子目标依赖性的信念。当这些信念发生变化时,失败既不能通过更长的推理痕迹也不能通过普通的自我反思来修复,因为缺失的证据存在于环境中。我们将环境探测制定为结构化代理世界模型的预算决策问题:在行动之前,代理可以查询一个信念字段的当前值,更新其表,并支付一个交互步骤。我们引入了 EnvProbe,这是一种简单的评分策略,它结合了任务关键性、陈旧性、语言不确定性和依赖角色。类型分层分析将信念修复的好处与替代任务行动的成本分开,并预测程序和空间信念的不同行为。在具有黄金置信状态的三个受控环境中,EnvProbe 将程序工具依赖性任务的终端世界状态准确度比定期探测提高了 11.76 个百分点,在空间任务上提高了 3.79 个百分点,总体提高了 6.45 个百分点。消融表明任务结构术语是收益的主要来源,而自我报告的不确定性在自信的错误信念下是不可靠的。结果表明,代理校准应被视为环境证据上的动作选择问题,而不仅仅是模型内部推理问题。

行动前先问世界:校准智能体世界模型的环境探查:论文配图
图 1:探针-作用校准权衡。长视野代理可以在计划修复陈旧的世界模型字段期间使用环境。好处取决于信念类型:程序场更容易瞄准,但更容易受到行动位移的影响,而空间场通常更倾向于结构性探索而不是自我报告的不确定性。