论文

在启发式自我改进代理中,自我创作的验证是不可靠的

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

智能体系统Agent 动作执行与治理

摘要

自我改进的智能体通过反复重写程序策略、控制器或启发式规则来积累能力。他们通常依靠自行编写的测试或指标来决定是否接受后续编辑。代理控制优化对象及其验证者。因此,自分配分数可以保持接近完美,而实际部署性能却下降或保持较低水平。我们通过验证者-部署差距来研究这个问题。这种差距是指代理自行编写的验证信号与代理无法观察或访问的密封部署评估之间的差异。我们询问自创作验证在迭代策略和测试重写下如何失败,失败如何随能力变化,以及多少外生信任足以阻止部署真正的回归。为了解决这个问题,我们引入了密封外源接受循环(SEAL)。海豹突击队保留了自己编写的测试,但通过固定的Harness侧审核将每个候选人与现任者进行比较。代理无法编写或检查审计,仅接收接受/拒绝,并且在明确回归后保留整个现有状态。我们的实验表明这个问题经常出现在启发式学习环境中。这些设置需要通过反复试验来发现目标。我们进一步发现,自写验证的失败是按能力分层的。较弱的智能体往往会破坏先前在简单自测背后获得的策略。更强的代理更稳定,但它们仍然会错误地测量部署分布。标准的自写约束并不能可靠地缩小这一差距。相比之下,SEAL 在六个模型和三个随机种子中的表现优于未受保护的基线。可靠的自我改进不需要放弃自我验证,但它需要至少一个在代理控制之外的部署接受信号。