论文
从预测到论证:通过强化学习将情感推理与人类基本原理结合起来
From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning
摘要
虽然基于方面的情感分析(ABSA)系统在识别情感极性方面取得了很高的准确性,但它们通常作为“黑匣子”运行,缺乏人类情感认知特征的明确推理能力。人类不仅对情感进行分类,而且还对情感进行分类。他们为自己的判断构建因果解释。为了弥补这一差距,我们提出了 ABSA-R1,这是一个 大语言模型 框架,旨在模仿这种“先推理后预测”的认知过程。通过利用强化学习 (RL),ABSA-R1 学会阐明事物背后的原因,生成为其情感预测奠定基础的自然语言理由。我们引入了认知对齐奖励模型(以前称为情感感知奖励模型),该模型强制生成的推理路径与最终情感之间的一致性此外,受元认知监控的启发,我们实施了一种性能驱动的拒绝采样策略,选择性地针对模型内部推理不确定或不一致的困难情况。四个基准的实验结果表明,与非推理基线相比,为模型配备这种显式推理能力不仅可以增强可解释性,而且可以在情感分类和三元组提取方面产生优异的性能。