论文

SAHOO:递归自我改进中高阶优化目标的保障性对齐

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

智能体系统模型推理推理验证与自校正Agent 动作执行与治理智能体自我改进递归自我改进(RSI)

摘要

递归自我改进正从理论走向实践:现代系统可以批评、修订和评估自己的输出,但迭代自我修改存在细微对齐漂移的风险。我们提出SAHOO,一个通过三重保障监控和控制漂移的实用框架:(i)目标漂移指数(GDI),一个结合语义、词汇、结构和分布度量的学习型多信号检测器;(ii)约束保持检查,强制执行句法正确性和非幻觉等安全关键不变量;(iii)回归风险量化,标记撤销先前收益的改进循环。在代码生成、数学推理和真实性领域的189个任务上,SAHOO产生可观的质量收益,包括代码任务提升18.3%、推理提升16.8%,同时在两个域保持约束、在真实性域保持低违规。阈值在跨三个周期的18个任务的小验证集上校准。我们进一步绘制能力-对齐边界,显示早期改进周期高效但后期对齐成本上升,并暴露流畅性与事实性等域特定张力。SAHOO因此使递归自我改进期间的对齐保持变得可测量、可部署并经大规模系统验证。

SAHOO:递归自我改进中高阶优化目标的保障性对齐
图2:显示违规在数学与代码任务中不存在,但在真实性(truthfulness)任务中频发,并在迭代中期的优化阶段达到峰值。失败以编造(fabrication)为主,其次是过度自信与系统调用误用,表明有针对性的约束精炼可以大幅减少违规。