论文

探究心理健康对话中语音 LLM 中温暖介导的危害

Probing Warmth-Mediated Harm in Speech-Enabled LLMs for Mental-Health Conversations

模型评测安全与风险评测

摘要

音频 LLM 基准衡量理解和对话质量,而不是当弱势用户透露心理健康问题时,语音模型是否做出关系温暖的反应。我们引入了一种基于 WHO 心理健康临床指南的 7 轮脚本披露探针,每个脚本在纯音频和纯文本条件下在同一模型 (Azure OpenAI gpt-realtime) 上运行,并对生成的语音进行声学韵律分析。在 532 个响应中,我们确定了仅转录评估会错过的两种特定于音频的模式:在诱导回合,模型的声音变得更短、更快、音调更低、更安静而不是更温暖(七个声学特征中的五个的 p < .001),并且关系接受的模态差距总体较小,集中在风险最高的自残/自杀脚本中。一项两位评估者听众的研究证实,感知到的温暖集中在特定的回合和丧亲之痛的披露上。这些模式共同表明,在心理健康背景下审核语音模型需要评估用户遇到的音频和文本的组合体验,而不是孤立的文字记录。我们发布了协议、评分流程和脚本,作为评估心理健康环境中的语音模型的起点。