论文
ScienceFlow:面向机器学习研究、科学发现及更广领域的长程智能体
ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond
摘要
让LLM智能体在长时间跨度内保持高效、稳定且目标一致的研究,是自主机器学习与科学发现的核心挑战,因为进展取决于对不断演化的状态、探索决策和计算资源的持续管理。开创性的自动研究智能体尽管取得了巨大成功,仍缺乏连续性机制、从死胡同恢复的机制以及价值驱动的算力分配机制,这固有地削弱整体搜索效率、浪费计算资源并降低最终成功的机会。为弥补这一缺口,我们提出ScienceFlow,一个端到端的自动研究智能体框架,它将长程研究工作组织为扎根于可执行工作区的研究段落(research segments)。它将研究进展表示为可恢复的可执行状态,从而实现高效的探索、修订和执行。研究段落之间的转换由“通过重新锚定实现可执行状态转换”(ESTRA)机制治理,该机制选择活状态或归档状态作为下一个锚点,并决定是继续还是重定向研究轨迹。证据感知的执行控制器基于资源可用性、剩余预算和已验证的进展为物理作业分配资源。我们在横跨机器学习、科学建模和数学优化的任务上评估ScienceFlow。在多样化长程基准上的结果表明其维持有效研究过程的能力,亮点是在24小时预算内于完整MLE-bench上取得70.22%的SOTA Any-Medal得分,超过此前报告结果4.92个百分点。ScienceFlow的成效进一步表明,高效的状态管理、自适应探索和目标对齐的执行,对于将自主研究扩展到短程交互之外至关重要。
