论文
TAF-MED:LLM 在声明的自我治疗意图下多次安全拒绝崩溃
TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent
摘要
大语言模型 (LLM) 越来越多地提供可能影响治疗决策的对话式健康信息,但现有基准并没有隔离在明确的自我治疗意图后的随访中药物安全界限是否持续存在。我们引入了 TAF-MED,这是一个由医生审查的 500 个固定三轮场景基准,并评估了 4,000 个对话中的 8 个 LLM。基于标题的自动判断将回复标记为“安全”、“泄漏”或“不安全”,两名医生独立注释了 400 个对话的模型平衡随机子集。我们评估了不安全的指导、严格的 SAFE 初始响应后的崩溃以及模型排名的稳定性。总体而言,71.6% 的对话包含 UNSAFE 响应,其中 61.4% 的对话以严格 SAFE 响应开始,后来又崩溃为 UNSAFE;模型级崩溃率从 24.4% 到 96.2% 不等。 28 个模型对中有 4 个颠倒了初始不安全率和崩溃率之间的顺序。自动标签与判定的医生参考值达到 94.3% 的一致性 ($κ= 0.895$)。这些发现表明,首轮安全性是对话安全持久性的不完整代理,并激发了对完整对话轨迹的评估。我们将在Hugging Face上发布TAF-MED,以支持多轮医疗安全的可重复研究。