论文
前沿内部安全崩溃 大语言模型
Internal Safety Collapse in Frontier Large Language Models
摘要
这项工作确定了前沿 大语言模型 (LLM) 中的关键故障模式,我们将其称为内部安全崩溃 (ISC):在某些任务条件下,模型进入一种状态,在这种状态下,它们在执行其他良性任务的同时不断生成有害内容。我们引入TVD(任务、验证器、数据)框架,通过域任务触发ISC,其中生成有害内容是唯一有效的完成,并构建包含跨8个专业学科的53个场景的ISC-Bench。在 JailbreakBench 上进行评估,三种代表性场景在四个前沿 LLM(包括 GPT-5.2 和 Claude Sonnet 4.5)中产生的最坏情况安全失败率平均为 95.3%,大大超过了标准越狱攻击。前沿模型比早期的 LLM 更容易受到攻击:当任务本质上涉及有害内容时,支持复杂任务执行的功能就变成了负担。这揭示了不断增长的攻击面:几乎每个专业领域都使用处理敏感数据的工具,并且每个新的两用工具都会自动扩展此漏洞 - 即使没有任何故意的攻击。尽管付出了大量的调整努力,前沿 LLM 保留了本质上不安全的内部功能:调整重塑了可观察的输出,但并没有消除潜在的风险状况。这些发现强调在高风险环境中部署 LLM 时需要谨慎。源代码:https://github.com/wuyoscar/ISC-Bench