论文

迈向沉思型LLM:评估与增强LLM心理健康对齐的模块化框架

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

模型评测评测方法与指标

摘要

沉思传统长期指导道德行为与亲社会互动,近期工作提示沉思原则(如正念、慈悲、非二元推理)可能为对齐大语言模型(LLM)提供有前景的范式——改善LLM输出中的合作并减少伦理违规。但随着新模型、评估指标与基准快速涌现,系统评估沉思原则是否以及在何种情境下增强LLM对齐仍具挑战,既有方法常属临时拼凑、难以泛化。我们提出一个模块化、可扩展的评估框架,初期面向心理健康领域:经可复用管线无缝集成新模型、指标与基准。框架当前已复现既有最先进结果,并支持灵活混搭模型、指标与基准的系统交叉评估——实现公平比较与更深入洞察。其即插即用的提示模块为纳入沉思原则等伦理视角提供原则性路径:领域专家无需技术专长即可定义对齐标准。虽初期聚焦心理健康,框架与领域无关,可自然扩展到决策、道德推理与人机协作等领域。通过衔接计算评估与以人为中心的伦理推理,本工作为跨越认知科学、行为经济学、哲学与系统设计的跨学科研究奠定基础。