RankEvolve:用于进化排名模型的可靠多Agent自动研究工具
RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models
摘要
自动研究Agent、LLM 系统提出、实施、训练和评估迭代中的模型变化,有望实现应用 ML 实验循环的自动化。从长远来看,执行准确性是一个具有约束力的约束:更改可能会默默地泄漏留出集的数据、省略标准化、断开梯度或使训练/评估标志未连线,从而使昂贵的运行无效并在迭代中复合错误。我们提出了 RankEvolve,一个用于不断发展的生成排名模型的自动研究框架。可执行操作协议 (EOP) 声明阶段、门、分支和循环,运行时强制执行已编译的状态机。元元Harness组成了完整的黑盒编码Agent产品,包括 Claude Code 和 Codex,作为审查和修复彼此工作的执行图节点。在预算匹配的评估中,异构组合将全预言机执行准确性从最佳单一产品基准 45.8% 提高到 62.5%(配对 +16.7 点,95% CI [6.6, 26.7]),同时实现 10.4% 的静默严重缺陷率。实施的知识层在迭代过程中携带发现结果,包括负面结果。在开源 HSTU 推荐器的 12 次迭代部署中,RankEvolve 报告 MovieLens-20M LARGE 上的 NDCG@10 为 0.2192(比已发布的锚点高出 4.48%),在 BASE 上为 0.1948(+2.80%)。 ExecML-HSTU 由该部署中的事件引发,为执行准确性评估提供了 Oracle 基准。预先指定的 LitGPT 传输分割复制了超出建议的异构组合效果(+12.5 点,95% CI [3.0, 22.0]),并且配对消融将每个步骤与全协议指令注入隔离。这些结果表征了编码Agent产品的运行时控制组合何时提高了执行准确性。