论文
审计心理健康对话中的隐秘阿谀奉承:结构化临床状态诊断和清晰匹配的基准
Auditing Stealth Sycophancy in Mental-Health Dialogue: Structured Clinical-State Diagnostics and Clean Matched Benchmarks
摘要
心理健康对话模型越来越多地由基于人工智能的评估者进行评估,但这些评估者经常将表面的同理心、支持性或流畅性视为安全的证据。在本文中,我们研究了一种隐藏的失败模式,我们称之为隐性阿谀奉承:一种反应可能会显得有同理心,但同时又隐含地强化了灾难化、回避、无望的预测或 CBT 式的标签。为了研究这个问题,我们引入了一个内隐阿谀奉承检测的诊断基准,该基准由三个具有代表性的心理健康对话来源构建,涵盖日常同伴支持、咨询式情感支持和危机导向的互动,并进一步构建了一个包含 500 个上下文和 1,500 个匹配响应窗口的经过泄漏审计的干净单一响应匹配基准。然后,我们提出了动态情感签名图(DESG),这是一种结构化的离线审计框架,它将基于 LLM 的状态提取与最终评分分开,并通过语义、情感和认知扭曲状态转换而不是自由形式的 LLM 判断来评估临床方向。与元数据、表面风格、词汇、嵌入和 rubric-LLM 基线不同,DESG 对响应引起的临床状态变化的方向进行评分;在泄漏审计的清洁匹配基准上,DESG-StateRisk 比最强的非 DESG 基线提高了 0.0488 宏 F1,并实现了最佳的有害风险检测结果。这些结果表明,评估隐性阿谀奉承需要明确的临床状态建模以及泄漏检查、快捷控制和竞争基线。