论文
Mental-R1:对齐LLM推理用于心理健康评估
Mental-R1: Aligning LLM Reasoning for Mental Health Assessment
摘要
焦虑、抑郁和自杀等心理健康问题仍然是紧迫的全球挑战,及时、准确的评估对于有效干预至关重要。最近,大型语言模型已被探索用于心理健康评估。然而,现有的通用后训练方法与人类评估的认知过程不相符,这可能导致推理结果不可靠。为了弥补这一差距,我们提出了认知相对策略优化(CRPO),这是一种专为心理健康领域量身定制的强化学习框架。 CRPO 通过将阶段相关的不确定性模型集成到政策优化过程中来扩展群体相关政策优化。具体来说,我们引入了一种分阶段的熵正则化机制,鼓励在早期推理阶段进行广泛探索,并在后期阶段逐步加强自信的决策,模仿人类从不确定性到确定性的认知转变。此外,受认知评估理论的启发,我们将认知推理阶段形式化,从而指导基于理论的可解释推理。对 8 个心理健康数据集的实验表明,CRPO 的加权 F1 分数比最佳强化学习基线平均提高了 10.4 个百分点。此外,CRPO训练的模型Mental-R1在推理密集型案例上与现有的大型语言模型相比表现出明显的优势,这表明CRPO增强了心理健康评估的推理能力。
