论文

多语言情感感知文本摘要一致性维护的强化学习方法

Multilingual Sentiment Aware Text Summarization A Reinforcement Learning Approach for Consistency Maintenance

模型训练偏好优化

摘要

基于人类反馈的强化学习(RLHF)显着提高了 大语言模型 在文本摘要方面的质量和流畅性。然而,它对情感特性的影响仍然没有得到充分的了解。在这项工作中,我们研究情绪漂移,即与源文本相比,基于 RLHF 的摘要输出中向中性情绪的系统性转变。我们在多个数据集、模型架构和八种语言中进行了广泛的实验,以分析对齐目标如何影响情感保留。我们的结果表明,情绪漂移是一种一致的现象,随着 KL 正则化强度的增加而变得更强,表明对齐稳定性和情感保真度之间存在权衡。为了解释这种行为,我们引入了一个策略归因框架,该框架分解 RLHF 目标并量化其组件的贡献。我们的分析表明,KL 正则化是所有环境下情绪抑制的主要驱动力。基于这些发现,我们提出了对 KL 正则化项的情感感知修改,它有选择地减少对情感承载词元的约束。实证结果表明,这种方法可以减轻情绪漂移,同时保持摘要质量。总的来说,我们的研究结果凸显了当前对齐方法的根本局限性:虽然它们提高了事实一致性和安全性,但它们可能会无意中抑制情感表达。这激励了明确考虑情感保存的协调策略的制定。