论文

Thomson:面向SovereignAI(主权AI)的前沿模型持续学习

Thomson: Continual Learning of Frontier Models for SovereignAI

模型训练持续学习

摘要

前沿模型的开发通常被认为是一小批资金雄厚的玩家专属的领域,这在开发者与现代AI多元用户群体之间造成了信息、经济和权力的不对称。近期的公共讨论承认了这一担忧,呼吁SovereignAI(一个组织独立构建、部署和治理AI使用的能力),但对于在各种资金条件下如何在短期内实现这一点,几乎没有给出具体建议。我们主张,通过对现成的开放权重模型进行持续学习,广泛的机构也能够达到前沿性能。与小型微调、提示工程或对冻结模型进行工具增强等有限手段不同,我们的方法利用现代的中期与后训练技术栈,同时在每个阶段引入既保持可塑性又保持稳定性的保障措施,对参数进行数量最少的高影响干预。这带来了通常需要跨越多个连续模型代际才能获得的增益,而计算与人力预算远低于通常设想,使更大范围的行动者能够拥有SovereignAI技术栈的大部分(模型、工具基础设施、价值观与数据隐私)。我们以Thomson展示这一点,这是一个通用前沿模型,训练时特别强调高风险专业工作。Thomson在智能体任务、安全性、法律、税务与多语言以及大规模深度研究方面与近期前沿模型表现相当。评估显示出一个独特的π形模式:在包括未被显式针对的广泛能力上均有明显提升,同时几乎完全消除了窄域适配中常见的遗忘问题。

Thomson:面向SovereignAI(主权AI)的前沿模型持续学习:论文配图
图6:失调率与能力保留。我们的重对齐勾勒出严格优于纯 abliteration 基线的前沿,在明显更低的对基模型 KL 散度下达到任意给定的失调水平。(a) 验证提示集上的失调率与对基模型 KL 散度的关系;浅色标记为单次试验,实色标记并以虚线相连者为 Pareto 前沿。注意:为便于比较,基线的 KL 分数按我们的 KL 分数定义重算,其前沿则按原始 KL 分数选取。(b) 达到每个失调率所需的 KL 散度代价;我们的重对齐方法比基线少产生 2.0×2.0\times–5.0×5.0\times 的 KL 散度分数,表明消融过程中模型能力保留更好。