论文

SIGMA:由模型规范驱动自我改进对齐泛化

SIGMA: Self-Improving Alignment Generalization from a Model Spec

模型训练智能体系统强化学习智能体自我改进Agentic RL

摘要

LLM 智能体执行复杂任务的能力越来越强,并在软件工程和数学等易于验证的目标上递归地改进自己。由于一致性更难验证,因此如果没有适当的安全一致性,能力增加的风险就会越来越大,特别是当能力扩展到自动研究和网络安全时。现有方法侧重于使用可验证的反馈进行能力自我改进,或通过更强大的模型或策划数据的监督来调整训练,从而为调整创建外部监督瓶颈。我们询问当前模型是否可以改进其自身的安全对齐,并提出 SIGMA,这是一种数据生成和训练管道,可实现对齐自我改进,并推广到分布外设置。仅给出说明模型所需行为的“模型规范”,SIGMA 利用模型的推理能力来加强其自身的安全推理。 SIGMA 首先进行规范引导的任务合成,使用候选模型作为任务设计器智能体来生成各种对齐困境场景,并将其转换为训练任务,以压力测试其对模型规范的理解。接下来,SIGMA通过有监督的微调和基于规则的强化学习,以模型本身作为奖励模型,进行自我判断对齐训练。尽管训练仅在单轮聊天数据上,SIGMA提高了多轮Agentic环境中的安全对齐(AgentHarm危害性从22.6下降到14.8;Agentic错位从79.1下降到3.8),优于Deliberative Alignment和Constitutional AI基线,并保留一般能力。分析表明,平衡无害和有益的模型规范、安全审议的测试时推理以及 SIGMA 任务设计器智能体的高质量评价标准对于有效的自我提升至关重要。

SIGMA:由模型规范驱动自我改进对齐泛化:论文原图
图 1:SIGMA 使模型能够构建自己的对齐监督。首先,规范引导的任务合成通过 Agentic 任务生成和自验证循环构建高质量的任务提示和评估规则。接下来,自我判断对齐训练使用模型本身作为基于 rubric 的 RL 的奖励模型以及模型规范奖励。同一模型$\pi$充当任务设计者智能体、验证者、训练判断者以及正在训练的学习者模型。