论文

RSIBench-Data:以数据为中心的递归自我改进研究基准测试

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

模型评测基准与评测资源

摘要

递归自我改进需要将模型失败的证据转化为更好的模型。以数据为中心的 后训练 研究需要诊断能力差距、设计和验证训练数据策略以及从检查点反馈中学习。 LLM 代理可以自动执行此循环吗?现有的基准将研究决策与优化、服务、评估和系统实施纠缠在一起,模糊了代理的研究能力。我们引入 RSIBench-Data,这是 LLM 代理的受控基准,作为具有固定 后训练 堆栈的以数据为中心的研究人员。代理迭代地修改固定目标模型的训练数据策略;训练和服务使用 Tinker 支持的服务,官方评估通过 Harbor 和 E2B 沙箱运行,预算在代理之间固定。我们根据软件工程、终端使用、科学问答和数学的六个基准对四位前沿代理进行评估。代理展示了以数据为中心的核心研究能力:在 58.33% 的设置中,他们通过根据反馈改进策略来改进第一次有效尝试。然而,改进并不一致。在获得最佳观察分数后继续进行的搜索中,78.26% 以较低分数的最终尝试结束,而其余的仅恢复相同的峰值。因此,即使后来的修改失败,强有力的候选人也可能会在竞选的早期或中途出现。轨迹分析识别出更强运行中的四种模式:准确的假设、基于验证的监督、行为一致的数据以及强检查点的保留。这些发现表明,当前的代理可以做出有用的以数据为中心的发现,但尚无法将反馈转化为一致的改进。 RSIBench-Data 为递归自我改进所需的研究能力提供了一个可测量、可审计的测试平台。我们在 https://github.com/evolvent-ai/RSIBench-Data 开源我们的代码。