论文

对话中发现:LLM 自学缩小多匝差距

Found in Conversation: LLMs Teach Themselves to Close the Multi-Turn Gap

模型训练监督微调与指令调优

摘要

大语言模型 (LLM) 交互通常不明确,用户在多个对话回合中澄清所有必要的细节。然而,最近的研究表明,LLM 在这种多轮设置中的表现比在同时提供相同信息的单轮中表现要差得多,这种现象被称为“对话中迷失”。然而,有效弥合这一差距仍然是一个悬而未决的问题。在这里,我们介绍了 Found in Conversation (FiC),这是一个训练框架,模型可以在给定未指定的多轮提示的情况下自学找到并恢复其单轮能力。我们开发了视图不对称自我蒸馏,它提炼出同一任务信息的两个视图——教师的单轮视图,学生的多轮视图——将强的单轮行为转换为弱的多轮行为。这不需要更强大的外部老师,这是不可用的,因为即使是前沿的 LLM 也表现出这种差距。跨型号系列(Llama、Qwen、Phi 和 OLMo)和尺寸(3B-14B),FiC 恢复了至少 92% 的单轮性能,并在两个 Llama 主干上达到 100%,从而在单轮功能完好无损的情况下产生更高效、更有用的多轮对话。