论文
通过快速树搜索实现自我改进
Self Improvement via Fast Tree-search
摘要
编码智能体能够递归修改自身实现,形成自我改进循环。先前工作表明这能提升编码基准成绩,但现有方法成本高、计算密集。我们提出简单且样本高效的自我改进框架,在严格预算约束下显著提升编码表现。我们发现,候选自修改方案的评估是主要运行时间瓶颈,因为以往方法需要用修改后的智能体重跑一部分基准任务来估计有效性,耗时较长。我们提出通过快速树搜索进行递归自我改进的SIFT,在下游任务评估之外加入大语言模型评审信号,对候选补丁进行两两比较。胜负记录由正则化Bradley—Terry模型汇总,得到的实力分数在轻量级解耦树搜索中驱动按排名抽样父节点。昂贵的下游任务评估仅用于最有希望的节点。完全解耦的树搜索流水线利用评审分数提供中间信号,引导对有前景候选补丁的探索,避免受缓慢评估运行限制。SIFT在完整Polyglot基准上优于现有基于树搜索的自进化框架,同时显著降低CPU小时数、实际耗时和API成本等资源需求。
