论文
监督下 大语言模型 的多样性 微调
Diversity in Large Language Models under Supervised Fine-Tuning
摘要
受监督的 微调 (SFT) 对于使 大语言模型 (LLM) 与用户意图保持一致至关重要,但它被认为会抑制生成多样性。尽管这种减少经常被提及,但对该现象的正式实证检验仍然有限。 LLM 本身的表现力已通过多种现有方法解决。他们不同的观点表明,更深入的调查可以带来进一步的改进。在这项研究中,我们将这种下降归因于两个主要驱动因素:忽视 微调 数据集中的低频模式和忘记预先存在的知识。在理论分析的推动下,我们开发了 Tempered Focal (TOFU) 损失,这是一个同时解决这两个挑战的新颖目标。我们的广泛评估大规模证实了 SFT 后世代宽度缩小,并强化了解释这种效应的假设。在多个模型和基准测试中,我们证明了 TOFU 增强了输出多样性,同时保持了高响应质量,为 SFT 提供了原则性方法。