论文
缓解多轮智能体中的对话惯性
Mitigating Conversational Inertia in Multi-Turn Agents
摘要
大语言模型(LLM)在获得恰当示范时是出色的少样本学习者,但这一优势在多轮智能体场景中成为问题:LLM 会错误地把自身此前的回复当作少样本示例来模仿。通过注意力分析,我们识别出对话惯性这一现象,即模型对先前回复表现出强烈的对角注意力,它与限制探索的模仿偏差相关。这揭示了把少样本 LLM 改造为智能体时的一种张力:更长的上下文丰富了可用于利用的环境反馈,却也放大了损害探索的对话惯性。我们的关键洞察是:对于相同的状态,用更长上下文生成的动作比用更短上下文生成的动作表现出更强的惯性,这使得无需环境奖励即可构建偏好对。基于此,我们提出上下文偏好学习(Context Preference Learning),校准模型偏好,使其偏好低惯性回复而非高惯性回复。我们进一步在推理时提供上下文管理策略,以平衡探索与利用。在八个智能体环境与一个深度研究场景中的实验结果验证了我们的框架能降低对话惯性并带来性能提升。
