论文
成为我的导师:同策略 Co-蒸馏 通过同伴反馈进行共同 LLM 改进
Be My Tutor: On-Policy Co-Distillation for Mutual LLM Improvement via Peer Feedback
摘要
我们研究了多领域 LLM 训练,其中两个模型在不同领域中各自更强,通过 同策略 反馈相互指导来共同进化。与单向 蒸馏 或单模型 微调 不同,我们的目标是相互帕累托改进:每个模型跨领域进行改进,而不失去其原始强度。为此,我们提出 同策略 Co-蒸馏 (OPCoD),其中每个学生的自我 蒸馏 取决于其自己的正确部署和同伴的反馈。为了使反馈交换有效,OPCoD 使用基于认知的门控来决定何时提供反馈并将反馈锚定到问题中的地面反馈。在科学问答任务中,OPCoD 始终优于基线,并在所有评估的领域对和学生中实现帕累托改进。