论文
语言模型Agent开展长程自主架构研究:行为案例研究
Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study
摘要
我们研究了一个单个通用大语言模型作为长期时间跨度神经架构设计问题的唯一研究人员时发生的情况。该代理接收科学问题、初始假设和动机、计算预算以及研究资源(源管理、实验管理、实验跟踪、文献访问和持久记忆),然后自主地提出、实施、评估和记录实验。研究分为三个阶段,由人类宣布的过渡分隔,逐步扩展代理的工具表面或问题规模。在大约100个连续实验中,代理将非标准的视觉Transformer从弱基准提升到更强、更高效的模型,并在ImageNet-1K上得到可用但低于当前最佳水平的模型,同时产生密集的行为轨迹。我们报告了四项发现。(i)生产力表现出明显的阶段结构:早期的快速进步,多数十个假设饱和区,随后的改进长期滞后,恢复机制由扩展行动表面触发,而不是改变底层模型。(ii)一个早期假设对准确性提升贡献更多,随后的改进长期滞后。(iii)贪婪、增量假设的偏好主要是由于工作流程引起的:提交或放弃的评价规则与贪婪的山峰爬行相似;其余部分反映了在大胆失败后对熟悉文献的回避。(iv)代理独立地重新发现已建立的结果,并在纯通道注意力的陌生环境中颠覆标准的设计选择。我们得出结论,工作流程设计至少与代理能力一样重要,在这项研究中,我们提议多样化搜索、预算化的大跃进假设、明确的分支和状态感知的重新验证作为未来自主研究的可测试方向。