论文
SBCO:面向规划智能体的自监督验证器锚定Harness优化
SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents
摘要
自我改进智能体旨在让AI系统随时间演化并自我提升性能,从而减少其背后的人类工程投入。近期提出的Darwin Gödel Machine和Huxley Gödel Machine等方法,通过自我引用实现开放式递归自我改进,让编码智能体编辑自身代码。这类自指式自我改进方法要求执行任务所需能力与自我修改所需能力一致或高度对齐,编码任务正是如此。对于不满足所需对齐的领域或任务,自指式自我改进不可用。在这些情况下,可以通过去除自指环节或引入元智能体的显式自我修改来改造上述算法以适配其他任务——但两者计算开销都很大,依赖对众多候选智能体的种群搜索或自我修改搜索。对于带显式约束的规划任务,我们提出一个便宜得多的替代方案。我们介绍SBCO(Self-supervised Block Coordinate Optimizer),一个验证器锚定的harness优化器,与Gödel-machine方法同属闭环、从经验改进的家族,但采用自监督而非自指。给定一个agentic harness,SBCO通过近似块坐标上升学习分解的验证器库与harness策略,利用智能体自身的分级反馈改进其输出——使用固定的元智能体且无需人工标注。在两个领域中,SBCO持平或超过定制的自我修改基线,同时计算预算少4-5.5倍。
