论文

缓解多轮智能体中的对话惯性

Mitigating Conversational Inertia in Multi-Turn Agents

模型训练偏好优化

摘要

大语言模型(LLM)在获得恰当示范时是出色的少样本学习者,但这一优势在多轮智能体场景中成为问题:LLM 会错误地把自身此前的回复当作少样本示例来模仿。通过注意力分析,我们识别出对话惯性这一现象,即模型对先前回复表现出强烈的对角注意力,它与限制探索的模仿偏差相关。这揭示了把少样本 LLM 改造为智能体时的一种张力:更长的上下文丰富了可用于利用的环境反馈,却也放大了损害探索的对话惯性。我们的关键洞察是:对于相同的状态,用更长上下文生成的动作比用更短上下文生成的动作表现出更强的惯性,这使得无需环境奖励即可构建偏好对。基于此,我们提出上下文偏好学习(Context Preference Learning),校准模型偏好,使其偏好低惯性回复而非高惯性回复。我们进一步在推理时提供上下文管理策略,以平衡探索与利用。在八个智能体环境与一个深度研究场景中的实验结果验证了我们的框架能降低对话惯性并带来性能提升。

缓解多轮智能体中的对话惯性
图11:不同组件类型与上下文管理策略下的注意力分布分析。从上到下依次为:对角注意力(对先前助手回应的自注意力)、assistant 注意力(对所有 assistant token 的注意力)、system 注意力(对 system prompt token 的注意力)和 user 注意力(对用户输入 token 的注意力)。每个子图在三种上下文管理方式下比较基座模型与经 CPL 训练的模型:Long(完整上下文)、Window(仅近期上下文)和 Clip(过滤后的上下文)。