论文

ScienceFlow:面向机器学习研究、科学发现及更广领域的长程智能体

ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond

智能体系统Agent HarnessAgent Runtime

摘要

让LLM智能体在长时间跨度内保持高效、稳定且目标一致的研究,是自主机器学习与科学发现的核心挑战,因为进展取决于对不断演化的状态、探索决策和计算资源的持续管理。开创性的自动研究智能体尽管取得了巨大成功,仍缺乏连续性机制、从死胡同恢复的机制以及价值驱动的算力分配机制,这固有地削弱整体搜索效率、浪费计算资源并降低最终成功的机会。为弥补这一缺口,我们提出ScienceFlow,一个端到端的自动研究智能体框架,它将长程研究工作组织为扎根于可执行工作区的研究段落(research segments)。它将研究进展表示为可恢复的可执行状态,从而实现高效的探索、修订和执行。研究段落之间的转换由“通过重新锚定实现可执行状态转换”(ESTRA)机制治理,该机制选择活状态或归档状态作为下一个锚点,并决定是继续还是重定向研究轨迹。证据感知的执行控制器基于资源可用性、剩余预算和已验证的进展为物理作业分配资源。我们在横跨机器学习、科学建模和数学优化的任务上评估ScienceFlow。在多样化长程基准上的结果表明其维持有效研究过程的能力,亮点是在24小时预算内于完整MLE-bench上取得70.22%的SOTA Any-Medal得分,超过此前报告结果4.92个百分点。ScienceFlow的成效进一步表明,高效的状态管理、自适应探索和目标对齐的执行,对于将自主研究扩展到短程交互之外至关重要。

ScienceFlow:面向机器学习研究、科学发现及更广领域的长程智能体:论文配图
图2:ScienceFlow 系统架构。研究工作者(research workers)在可恢复的可执行状态上运行,并通过 ESTRA 治理的研究片段间转换来调整长程轨迹,同时证据感知的执行控制器协调物理资源分配与运行时执行。