论文

语言智能体的动作校准:历史何时成为经验

When History Fails to Become Experience: Action Calibration in Language Agents

上下文与知识记忆Agent记忆

摘要

语言智能体应借鉴先前尝试与环境反馈改进同一任务内的后续决策。但提供额外交互历史有时反而降低任务成功,提示智能体未能一致有效地利用这些信息。为考察这一局限,我们研究智能体如何使用历史。发现:历史总体上改善任务完成,但即使打乱过去的动作,大部分收益仍在;破坏动作与观察的对应关系只造成任务成功的轻度下降。由此我们假设:智能体在决定如何推进时并不可靠地把过去动作与其结果连接起来。为检验该假设,我们显式把每条返回观察标注为前一动作的结果——这个简单标注在不引入新环境信息的情况下提升任务成功并减少下一动作重复。基于此洞见,我们提出学习式校准器,显式重评过去动作并选择性记录经验以指导后续决策,把任务成功提升到结果标注之上。