论文

审核 大语言模型 中的框架敏感行为不稳定性以进行心理健康互动

Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地集成到心理健康支持工具和其他心理敏感的对话应用程序中。在这种情况下,行为稳定性和一致性对于值得信赖的人机交互非常重要。然而,语义上相似的关注点可以通过不同的上下文框架来呈现,从而可能引发不同的模型响应。这种对帧敏感的可变性可能会挑战用户对系统行为的期望,并使人工智能可靠性的评估复杂化。虽然之前的研究主要在行为层面上研究了这种影响,但人们对框架相关的变异如何反映在对齐语言模型的内部表征中知之甚少。在这项工作中,我们使用跨多个指令调整模型系列的多个上下文框架条件的受控匹配提示来研究这些效果。在各种架构中,框架系统地改变了解释响应倾向。逐层探测分析表明,行为相关信息在整个 Transformer 深度中仍然可解码,解码强度随体系结构而变化。此外,尽管有强大的词汇基线,但在各种架构中,保留的框架探针仍然始终高于机会。激活引导实验进一步表明,与框架相关的表征方向可以部分调节下游行为结果。最后,这些发现表明,在评估部署在面向心理健康的交互中的对话式人工智能系统的一致性和可信度时,对上下文变化的鲁棒性可能是一个重要的考虑因素。