论文
与专业代理人的汽车研究开发出有效且重要的训练方案
Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes
摘要
我们将汽车研究视为由外部测量驱动的封闭经验循环。每个提交的试验都包含一个假设、可执行代码编辑、评估者拥有的结果以及形成下一个提案的反馈。输出不是生成的论文或单个模型检查点,而是提案、代码差异、实验、分数和失败标签的可审计轨迹。我们用专业代理实例化这个循环,这些代理划分配方表面并在试验中共享测量的谱系。核心的实证发现是,沿袭反馈可以让智能体将评估者的结果(包括崩溃、预算超支、尺寸失败和准确性门失误)转化为后来的程序级配方编辑,而不是一次性建议。在 1,197 项头条新闻试验以及一次性设置和启动后的 600 项参数高尔夫控制试验中,人类在搜索过程中没有选择建议、编辑配方、覆盖分数或修复失败的试验。在三个标题运行中,相同的提交试验循环将参数 Golf 验证 bpb 降低了 $0.81\%$,将 NanoChat-D12 CORE 提高了 $38.7\%$,并将 CIFAR-10 Airbench96 wallclock 降低了 $4.59\%$,每个任务都由自己的外部评估器和合法性检查来衡量。该跟踪包括对 157 个标题运行提交和程序重写(例如 NanoChat 注意力内核路径更改)的严格架构域审核。在此范围内,循环自主编写代码、提交实验、吸收反馈、应用和组合每个环境内的已知技术,并改进公共启动方案。