论文

Dual-Frontier:Agent何时能信任其世界模型?

Dual-Frontier: When Can an Agent Trust Its World Model?

智能体系统模型训练强化学习Agent 动作执行与治理Agentic RL

摘要

学习得到的世界模型正成为通用Agent的关键:通过预测动作后果,它们支持规划与决策,同时减少对昂贵试错的依赖。这种依赖带来一个根本性的模糊:当一个由世界模型引导的决策失败时,仅凭轨迹可能无法判断是Agent的决策规则还是世界模型造成了损失。我们把这一失败归因问题形式化为回报损失的反事实分解,并证明其组成部分无法从被动交互中识别,即使对有限时域的规划器也是如此。这一障碍催生了Dual-Frontier,一种学习原则:只有当世界模型引导的决策的预测优势超过决策相关世界模型误差的认证界限时才予以准入;否则,证据将被分配用于世界模型验证。动作条件价值界限与闭环扩展保证了被准入决策的回报不减。经校准的门控与同步置信序列支持自适应的证据复用,并给出充分与必要的验证界限。受控的学习模型实验验证了预测的失败模式与认证行为,而跨骨干的工具使用基准在现实的Agent世界模型流水线中实例化了同样的“先验证后准入”规则,持续提升决策质量与可靠性。

Dual-Frontier:Agent何时能信任其世界模型?:论文配图
图3:不同基准与模型骨干上的净决策收益。红箭头表示 Dual-Frontier 相对 Always-WM 的 NDG 改善。