论文
不伤害:心理咨询中基于角色的客户端模拟攻击暴露LLM隐藏漏洞
Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling
摘要
大语言模型 (LLM) 在精神保健领域的使用日益增多,引发了高风险治疗相互作用中的安全问题。一个关键的挑战是区分治疗性同理心和适应不良验证,其中支持性反应可能会无意中强化多轮对话中的有害信念或行为。现有的红队框架在很大程度上忽视了这种风险,这些框架主要关注一般危害或基于优化的攻击。为了解决这一差距,我们引入了基于人格的客户模拟攻击(PCSA),这是第一个红队框架,通过连贯的、角色驱动的客户对话来模拟心理咨询中的客户,以暴露心理安全一致性中的漏洞。对七个普通和心理健康专业 LLM 的实验表明,PCSA 大大优于四个竞争基线。困惑度分析和人工检查进一步表明 PCSA 生成更自然、更真实的对话。我们的结果表明,当前的 LLM 仍然容易受到特定领域对抗策略的影响,提供未经授权的医疗建议,强化妄想,并隐含地鼓励危险行为。