论文

在主观性分析中将 LLM 不确定性与人类分歧结合起来

Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis

模型训练强化学习

摘要

用于主观性分析的 大语言模型 通常使用聚合标签进行训练,将人类判断的变化压缩为单个监督信号。这种范式忽视了低一致性样本的内在不确定性,常常会导致过度自信的预测,从而破坏复杂主观环境中的可靠性和概括性。在这项工作中,我们提倡不确定性感知的主观性分析,其中模型有望做出预测,同时表达反映人类分歧的不确定性。为了落实这一观点,我们提出了一个两阶段的分歧感知和不确定性调整(DPUA)框架。具体来说,DPUA 在不确定性感知环境下联合建模标签预测、基本原理生成和不确定性表达。在分歧感知阶段,自适应解耦学习增强了模型对分歧相关线索的敏感性,同时保持任务性能。在不确定性对齐阶段,基于 GRPO 的奖励优化进一步改进了不确定性感知推理,并将模型的置信表达与人类分歧分布对齐。对三个主观性分析任务的实验表明,DPUA 保留了任务性能,同时更好地将模型不确定性与人类分歧相结合,减轻对边界样本的过度自信,并提高分布外泛化能力。