论文
AI4AI-Bench:面向递归自我改进的算法设计型LLM智能体基准
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
摘要
递归自我改进(RSI)追问的是:一个AI系统能否改进产生AI系统的过程,让下一个系统继承这一改进。该过程就是训练算法:更好的目标函数或更新规则会改善此后每一次运行的算力-能力兑换率,包括产出下一个智能体的那一次。因此RSI是否可行,取决于智能体能否设计训练算法。目前没有基准能单独隔离这种能力:现有套件靠收集数据或调超参数即可取胜,且没有一个能把“改变一次运行如何执行”与“改变模型如何学习”区分开。我们提出AI4AI-Bench,包含10个冻结的研究代码库,覆盖10个训练算法家族。在每项任务中,智能体在一块B300上有4小时时间重写训练算法;随后其代码从头重跑至多12小时,由一个对智能体隐藏的固定评估器、按与代码库原算法相同的流程打分对比。由于10项指标彼此不可通约,每项任务都被映射到同一把标尺上:0对应无信息量的模型,0.1对应代码库自带的算法,1.0对应任务最优值。在全部10项任务上,6个系统的29种配置的平均得分为0.166,最佳系统达到0.250:即便最强系统,也只走完原有算法到最优值之间距离的五分之一不到。提交结果揭示了差距去向:大多数提交根本没有改变模型的学习方式,而这样做的少数派平均得分0.226,其余为0.126。更多推理投入主要换来的是改变学习方式的意愿:该少数派在提交中的占比从8%升至64%,平均得分从0.094升至0.196。我们发布任务套件、评估器及所有已计分的提交,以便在这些系统演进时可以重复这一测量。