论文
超越重叠指标:忠实多角色对话总结的奖励推理和偏好
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
摘要
多角色对话摘要需要对多个说话者之间的复杂交互进行建模,同时保留特定于角色的信息和事实一致性。然而,大多数现有方法针对 ROUGE 和 BERTScore 等自动指标进行优化,这些方法倾向于对参考文献进行表面模仿,而不是 忠实性 中的真正收益或与人类偏好保持一致。我们提出了一种新颖的框架,它将显式认知风格推理与基于奖励的优化结合起来,用于多角色对话摘要。我们的方法首先从大型教师模型中提取结构化推理轨迹(例如,逐步推理和中间反射),并将它们用作辅助监督,通过分阶段监督 微调 初始化推理感知摘要器。然后,它将 GRPO 与双原则奖励相结合,将基于度量的信号与针对关键信息覆盖、隐式推理、事实 忠实性 和简洁性的人性化标准相结合。多语言多角色对话基准的实验表明,我们的方法与 ROUGE 和 BERTScore 上的强基线相匹配。具体来说,CSDS 的结果证实了该框架在语义一致性方面的稳定性,而 SAMSum 的深入分析则表明在事实 忠实性 和基于模型的偏好对齐方面取得了明显的进步。这些发现强调了推理意识和偏好意识训练对于可靠的对话总结的价值。检查点和数据集可在 https://huggingface.co/collections/NebulaPixel/summorchestra-multirole-summary 获取。