论文
PsychoSafe:在 大语言模型 中引发基于心理的拒绝
PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models
摘要
大语言模型 (LLM) 经常面临应被拒绝的请求,从而在帮助和预防伤害之间进行权衡。然而,拒绝本身可能会有所帮助。在涉及危机、胁迫或升级意图的高风险互动中,直接不遵守可能会防止直接伤害,但仍然无法满足请求背后人员的需求。我们提出了 PsychoSafe,这是一个基于心理学的拒绝框架,它将拒绝重新定义为基于循证干预策略的结构化支持性沟通。为了开发 PsychoSafe,我们构建了一个由 8019 个提示响应对组成的语料库,涵盖五个心理显着风险领域,并将提示和参数高效的 微调 应用于 Qwen 3.5 27B。在由 LLM 法官评估并通过人类评级进行验证的 500 个提示的平衡验证集上,PsychoSafe 提示将整体拒绝质量比通用基线提高了 28.1%,在外部资源推荐 (+46.8%) 和心理基础 (+34.8%) 方面取得了特别显着的进步,同时保留了非拒绝任务的下游性能。 微调 实现了近乎完美的拒绝率和资源转介率,但降低了响应相关性。对 SORRY-Bench 和 XSTest 的其他评估显示出强大的域内鲁棒性,但域外泛化能力有限,这表明未来的工作应该使 微调 数据多样化,以帮助模型有选择地而不是示意性地应用干预措施。