论文
SLA:用无状态语言 Agent 扩展长程自动研究
Stateless Language Agents: Scaling Long-Horizon Automated Research
摘要
自动科研系统越来越多地长程运行LLM Agent,但更多推理不自动带来更多进展:它们反复读取增长的历史、重复彼此工作,甚至停止实验而继续消耗词元。多数评测预算短或很快饱和,没有覆盖这些失败。我们将其归因于研究状态存放位置及下一步实验的决策者,提出无状态语言Agent(SLA):搜索有状态,Agent无状态。Agent不跨调用携带对话,Harness持久保存候选解及实测结果,每次重建新鲜的角色专用上下文,使可见信息成为显式设计选择。无状态Advisor读取各搜索方向的Harness汇总证据,给并行Worker分配具体实验。在软件工程、内核优化和算法设计中,采用最高十亿词元预算,与三个近期框架比较。SLA每任务最终结果最佳,达到最强内核基线最终表现时词元用量减少超过84%。共享检查点消融显示,聚焦上下文和明确任务分配均贡献进展,作用可在完整运行中叠加;Advisor仅消耗不到0.6%词元。结果支持把持久科研状态放到对话之外,并表明短时评测可能误判研究系统和组件。
