论文

通过强化学习教授 LLM 类人编辑不当论证

Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement Learning

模型训练强化学习

摘要

编辑人类编写的文本已成为 大语言模型 (LLM) 的标准用例,例如,使某人的论点更适合讨论。然而,将人类与 LLM 生成的编辑进行比较,我们发现编辑策略不匹配:虽然 LLM 经常执行多个分散的编辑并倾向于显着改变含义,但人类宁愿将依赖的变化封装在独立的、保留含义的编辑中。在本文中,我们提出了一种强化学习方法,教授 LLM 类人编辑,以提高论点的适当性。我们的方法产生独立的句子级编辑建议,可以独立接受或拒绝。我们使用组相对策略优化和多组件奖励函数来训练该方法,该函数联合优化编辑级别的语义相似性、流畅性和模式一致性以及参数级别的适当性。在自动和人工评估中,它超越了竞争基准和类人编辑的最先进水平,多轮编辑实现了接近完全重写的适当性。