论文
JT-SAFE-V2:以世界上下文数据实现设计即安全的基础模型
JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data
摘要
我们提出JT-SAFE-V2,一个旨在提升基础模型安全性与可信性的大语言模型,它在此前JT-Safe模型的基础上向更全面的设计即安全范式推进。JT-SAFE-V2通过若干关键创新强调通用智能与设计即安全的联合优化:用上下文世界知识充实预训练数据、高确定性预训练流程,以及面向企业级智能体能力的安全强化后训练机制。在这些安全增强的基础模型之上,我们提出Safe-MoMA(Safe Mixture of Models and Agents),一个通过多模型与多智能体的协同编排部署实现可追溯且高效推理的框架。大量评估表明,JT-SAFE-V2在通用智能与安全基准上均达到最先进性能。此外,与使用最大独立模型基线相比,Safe-MoMA在保持相当性能的同时将推理成本降低超过30%。为促进设计即安全基础模型的后续研究,我们公开发布了后训练的JT-SAFE-V2-35B模型检查点。
