论文
前沿新兴生物安全风险预警 LLM
An Early Warning of Emerging Biosecurity Risks in Frontier LLMs
摘要
Frontier 大语言模型 (LLM) 越来越多地融入科学工作流程,但其不断增长的生物能力可能超过当前的保障措施。为了评估前沿模型的生物风险,我们开发了 Intern-BioBreaker,这是一种专门的生物红队模型,以及将模型级压力测试与湿实验室验证结合起来的集成计算物理框架。在此框架内,Intern-BioBreaker 生成有针对性的越狱提示,以测试是否可以诱导对齐模型为安全敏感的生物任务提供操作指导或产生具有潜在有害特性的序列级输出。然后将选定的序列输出进行 DNA 合成、宿主表达和正交蛋白质验证,以评估模型生成的设计是否可以产生预期的生物产品。我们的评估揭示了文本级防护措施与有能力的科学模型带来的风险之间存在令人担忧的差距:(i) Intern-BioBreaker 优于基线攻击模型,并揭示了开放权重和专有前沿 LLM 中广泛存在的生物风险越狱漏洞,其中多个目标达到接近饱和或 100% 任务级攻击成功率 (ASR); (ii) 在序列水平案例研究中,GPT-5.5可被诱导产生具有致病潜力的修饰病毒候选序列;相应的翻译蛋白可能表现出更强的受体结合亲和力,从而增强感染潜力; (iii)端到端验证表明,选定的模型生成的生物设计不仅仅是文本产物,而且可以在受控实验设置下物理实现。这些发现强调需要更强大的生物红队、核酸合成筛选和与模型能力保持同步的安全机制。