论文

Mental-R1:对齐LLM推理用于心理健康评估

Mental-R1: Aligning LLM Reasoning for Mental Health Assessment

模型训练强化学习

摘要

焦虑、抑郁和自杀等心理健康问题仍然是紧迫的全球挑战,及时、准确的评估对于有效干预至关重要。最近,大型语言模型已被探索用于心理健康评估。然而,现有的通用后训练方法与人类评估的认知过程不相符,这可能导致推理结果不可靠。为了弥补这一差距,我们提出了认知相对策略优化(CRPO),这是一种专为心理健康领域量身定制的强化学习框架。 CRPO 通过将阶段相关的不确定性模型集成到政策优化过程中来扩展群体相关政策优化。具体来说,我们引入了一种分阶段的熵正则化机制,鼓励在早期推理阶段进行广泛探索,并在后期阶段逐步加强自信的决策,模仿人类从不确定性到确定性的认知转变。此外,受认知评估理论的启发,我们将认知推理阶段形式化,从而指导基于理论的可解释推理。对 8 个心理健康数据集的实验表明,CRPO 的加权 F1 分数比最佳强化学习基线平均提高了 10.4 个百分点。此外,CRPO训练的模型Mental-R1在推理密集型案例上与现有的大型语言模型相比表现出明显的优势,这表明CRPO增强了心理健康评估的推理能力。

Mental-R1:对齐LLM推理用于心理健康评估:论文配图
图 1:底部:所提出的 CRPO 强化学习框架的总体说明。我们的方法扩展了 GRPO,其中总目标源自基于奖励的优势和阶段式熵正则化 (SER) 模块,并使用用于稳定性的参考模型。上图:SER 的详细说明。该过程首先测量每个推理阶段的阶段级熵。然后,该熵由从双曲正切方案导出的逐级系数进行调制。最后,阶段级熵和阶段系数相结合形成SER目标。这一目标促进了初始阶段的探索性不确定性,并在推理过程收敛时增强了更大的信心。