决策充分状态表示:测量和减少写入时遗憾
Decision-Sufficient State Representations: Measuring and Reducing Write-Time Regret
摘要
长任务产生的历史记录比 LLM Agent在其上下文中可以容纳的历史记录还要多,而且即使在历史记录适合的情况下也比它可靠地使用的历史记录要多。因此,越来越多的工作让智能体携带一个简短的书面状态:在每一步,编写者都会重写状态,而读者仅根据状态进行操作。步骤很便宜,但在后来的决定表明他们需要它之前,作者放弃的任何东西都会丢失。我们量化这种损失并询问训练是否可以减少它。将书面状态与事后所写的相同大小的最佳状态进行比较,我们将读者的损失分为预算损失(任何该大小的状态都必须招致)和写入时遗憾(来自作者的选择)。在 TextWorld 烹饪游戏中,我们控制事实在需要之前必须携带多长时间,持有事实的 128 个词元状态几乎赢得每场比赛,而提示语言模型编写者最多获胜 17%。几乎所有的损失都是写入时的遗憾,并且随着延迟而增加。然后我们从读者自身的损失中训练作者。 DSSR(决策充分状态表示)根据作者提出候选状态后读者的表现来对候选状态进行评分,并教会作者选择更好的状态。这种前推分数可以预测游戏结果 ($\rho = 0.48$),而后见之明方法通常会在固定背景下对候选者进行评分,但不能预测游戏结果 ($\rho \leq 0.07$)。在预先注册的测试分组中,当很快需要事实时,训练会增加+7.0 [+1.9,+12.2]成功点,使简单的摘要编写者达到基于信念和基于位置的记忆提示的水平。增益随着延迟的增加而缩小,并且仅在最短延迟时才显着。我们将这个限制追溯到信用分配:只有当以后的每次重写也保留它时,保留一个事实才有回报,而每步分数无法看到这一点。