论文
相同的证据,不同的答案:多轮语言模型的规范上下文 同策略 蒸馏
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
摘要
大语言模型 (LLM) 通常会在单个提示中给出所有指令时解决任务,但在轮流中逐渐显示相同信息时会失败。当干净的完整提示和原始分片对话包含相同的完整用户证据时,模型仍应得出相同的答案。我们认为,造成这种差距的一个关键原因是自锚漂移:在部分信息下产生的响应引入了不受支持的假设,而这些假设后来扭曲了最终答案。为了减少这种影响,我们提出 Canonical-Context 同策略 蒸馏 (CCOPD)。在训练过程中,相同的基本模型被用于两个角色:一个以干净的完整提示为条件的冻结教师和一个通过多轮对话逐步接收相同证据的可训练学生; CCOPD 将学生的行为按照自己的轨迹与教师的规范全情境行为结合起来。仅针对数学问题对话进行训练,CCOPD 在数学和五个零样本域外任务系列中的 RAW-SHAREDED 性能比原始基本模型平均相对提高了 32%,同时在很大程度上保留了全上下文性能。进一步的分析表明,CCOPD 加强了用户证据的基础,并降低了对早期助理轮流污染的敏感性。