论文
Fork-and-flush:让研究 Agent 逃离想法盆地
Fork-and-Flush: Escaping Idea Basins in Autoresearch Agents
摘要
自动研究Agent反复提出候选解、评测并用反馈指导后续实验。我们发现同Agent在同任务的独立运行会停滞于显著不同分数,即使继续投入大量计算差距仍存在。按功能相似性嵌入候选产物进一步显示,轨迹局限于解空间的局部区域,我们称之为想法盆地。为帮助逃离这些区域,我们研究简单周期干预fork-and-flush:将Agent分叉为多条并行轨迹,每条继承累积工作区,但从全新聊天上下文开始;运行固定时长后,选得分最高的轨迹继续。在13项长程科研与工程任务、单Agent运行最长数天的实验中,同等计算预算下,按最小—最大归一化平均分,方法比单次运行和best-of-N分别相对提高66.0%和44.4%。
