论文
多轮对话指令调优的数据选择
Data Selection for Multi-turn Dialogue Instruction Tuning
摘要
指令调整的语言模型越来越依赖于大型多轮对话语料库,但这些数据集通常充满噪音且结构不一致,存在主题漂移、重复的闲聊以及跨轮对话的答案格式不匹配。我们从数据选择的角度解决这个问题,并提出 \textbf{MDS} (多轮对话选择),这是一种对话级框架,可以对整个对话而不是孤立的轮次进行评分。 MDS 结合了全局覆盖阶段和局部结构阶段,前者在用户查询轨迹空间中执行 bin-wise 选择,以保留代表性但非冗余的对话,后者通过基于实体的主题基础和信息进展来评估对话内的可靠性,以及用于功能对齐的查询-答案形式一致性。 MDS 在三个多轮基准和域内银行测试集上的性能优于强大的单轮选择器、对话级 LLM 评分器和启发式基线,在无参考和基于参考的指标中实现了最佳总体排名,并且在相同训练预算下的长时间对话中更加稳健。代码和资源包含在补充材料中。