论文

KARMA:Karma 一致的奖励模型适应

KARMA: Karma-Aligned Reward Model Adaptation

模型训练奖励建模与过程监督

摘要

人类交流依赖于隐含的社交信号,其有效性是由语气、语境和对话规范决定的,而不仅仅是语义内容。我们介绍了 KARMA(Karma 对齐奖励模型适应),这是一个 LLM 从大规模社交交互数据中学习上下文相关对话行为的框架。 KARMA 在 Reddit 对话上训练奖励模型,以预测基于上下文的响应评估,并使用该信号通过强化学习来微调语言模型,以提高语用介导任务的性能。重要的是,我们发现表现最好的奖励模型并不会导致更好的下游模型一致性:完全依赖于对话上下文的奖励模型对 Reddit 业力的预测效果更差,但产生了更好的下游性能。我们评估了 KARMA 应用于下游模型的效果,无论是否直接接触社交媒体数据。由此产生的模型显示出改进的语用介导的行为,并在很大程度上减轻了不良副作用。在所有条件下,KARMA 都会不断削弱事实性,包括当下游模型没有直接接触 Reddit 数据时,这表明这种张力是嵌入在奖励信号本身中的,而不是由噪声训练数据引入的。