论文

不漂移的AI科学家:四足导航研究回路中的品味、结构与可证伪发现

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

智能体系统Agent Harness

摘要

由大语言模型驱动的自主研究回路能够大规模运行机器学习实验,但往往漂移向对其所优化指标的局部改进,而不是检验激发实验的假设。我们从结构上解决这一问题,并提出一个用于研究仿真中四足机器人导航策略泛化性的AI科学家。在Karpathy的自研究(autoresearch)范式基础上,我们的回路增加三个组件:不可变的实验卡,以固定模式将每次迭代的预测与结果配对,使被证伪的假设无法被追溯改写;限于机械角色的专门子智能体;以及kkanbu——一个以类型化知识图谱承载用户研究品味的偏好oracle,是唯一被允许做出主观判断的组件。为隔离oracle的作用,我们在十一条研究流上以有无kkanbu两种设置各运行一次完全相同的回路。两臂均未漂移:二者各自证伪约四分之三的自身假设,且训练出的最佳策略来自无oracle一臂。oracle改变的是方向而非分数:只有它探索了测试时适应;在它所在一臂领先的流上,获胜设计出自它手;它还将经验跨流携带,而另一臂则反复重新推导这些经验。脚手架保持回路诚实;kkanbu决定回路看向哪里。