论文
EVOKE:在Agent中获取世界知识以进行可转移决策
EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making
摘要
大语言模型 (LLM) 越来越多地被部署为多步骤决策的Agent,但很难迁移到看不见的环境。世界模型方法通过训练Agent来预测未来的观察结果来解决这个问题,但代价是额外的训练和在使用预测进行规划时会出现的错误。然而,对于在数字环境中操作的大语言模型Agent来说,许多世界知识已经在预训练期间内化,这将问题从获取知识转变为引出知识。我们认为,典型的训练后对这种诱导几乎没有压力,因为在每个访问状态的单一目标下进行监督会无意中促使政策依赖于肤浅的情境习惯。我们引入了 EVOKE,这是一种训练后方法,通过固定状态下的目标多样性来提供这种压力。理论表明,能够跨越不同目标的Agent必须编码一个可从其行动偏好中恢复的世界模型,EVOKE 保持环境状态和交互历史固定,并将相同的候选行动排列在替代目标下,迫使行动偏好发生变化,从而使依赖于上下文习惯或单目标相关性的策略无法正确排序。这隐含地引出了政策预先训练的世界知识来为决策提供信息。我们在三个主干的不同任务中评估 EVOKE,展示了改进的任务性能、未见的环境泛化和数据效率。我们进一步进行受控分析,以更好地了解推动这些收益的因素。这些发现为通过直接决策监督获取内化的世界知识以进行可转移的行动提供了新的视角。