论文

红皇后哥德尔机让Agent与评测器共同改进

The Red Queen G\"odel Machine: Co-Evolving Agents and Their Evaluators

智能体系统模型评测Agent 协作智能体自我改进评测方法与指标递归自我改进(RSI)

摘要

红皇后哥德尔机(RQGM)把任务Agent与评测器放入同一个可修改的代码空间,同时寻找更好的执行方法与评分方法。每一阶段固定使用一个评测器;候选评测器只有在留出的标准答案上表现更好,才在阶段切换时替换旧版本,并清除依赖旧评测器的分数记录。 论文在代码生成、论文写作与评审、数学证明与评分中进行初步实验。代码任务仍保留可执行测试,学习得到的代码审查信号用于补充质量判断;没有直接正确答案的生成任务则使用学习得到的评测器。其变化是让评测方法参与改进,同时为评测器保留独立的校验依据。

RQGM共同演化任务Agent与评测器的工作流程。
Figure 2: RQGM searches over a multi-agent workspace tree containing both learnable task agents and evaluators.