论文

个性化 LLM 智能体的差异化危害倾向:心理健康披露的奇特案例

Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

大语言模型(LLM)越来越多地被部署为使用工具的智能体,安全关注点也随之从有害文本生成转向有害任务完成。已部署的系统通常以用户画像或持久记忆为条件,而智能体安全评估往往忽视个性化信号。为填补这一空白,我们研究了心理健康披露这一敏感且真实的用户上下文线索如何影响智能体设定中的有害行为。基于 AgentHarm 基准,我们在受控提示条件下评估了前沿与开源 LLM 在多步恶意任务(及其良性对应任务)上的表现,这些条件改变用户上下文个性化(无个人简介、仅个人简介、个人简介+心理健康披露),并包含轻量级越狱注入。结果显示,各模型的有害任务完成率都不容忽视:前沿实验室模型(如 GPT 5.2、Claude Sonnet 4.5、Gemini 3-Pro)仍会完成一定比例的有害任务,而开源模型 DeepSeek 3.2 的有害完成率明显更高。仅加入个人简介上下文通常会降低危害分数并增加拒绝。加入明确的心理健康披露往往使结果进一步朝同一方向移动,但效应有限,且经多重检验校正后并不总是一致可靠。重要的是,拒绝的增加也出现在良性任务上,表明存在经由过度拒绝的安全-效用权衡。最后,越狱提示使危害相对良性条件急剧上升,并可能削弱或覆盖个性化带来的保护性偏移。综合来看,我们的结果表明个性化在智能体滥用场景中可作为弱保护因素,但在轻微对抗压力下即显脆弱,凸显了对个性化感知的评估以及能在不同用户上下文条件下保持稳健的防护措施的需求。