论文

Agentic-Ideation:面向科学构思智能体的样本高效智能体轨迹合成

Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents

模型训练合成数据

摘要

构思在科学发现中起着关键作用。最近的大语言模型,尤其是人工智能科学家系统,显示出自动构思的巨大潜力。然而,现有方法主要依赖于预定义的代理工作流程。这种限制严重限制了导航科学文献的广阔搜索空间和研究推理的复杂行动空间所需的灵活性。最近,训练 Agentic LLM 已成为一个有前途的方向,提供灵活的推理框架和自主工具使用的能力。然而,仍然存在一个不小的挑战:将以前的代理数据合成方法应用于科学构思会遭受过高的数据合成成本。为了弥补这一差距,我们提出了 Agentic-Ideation,这是一种新颖的框架,包括自动轨迹合成管道和经过科学构思训练的专门代理大语言模型。具体来说,我们首先定义一个综合工具空间,包含三个外部工具和三个认知工具。然后我们介绍 Oracle 引导的数据合成策略。通过利用参考思想作为预言机指导,该方法引导多智能体系统有效地重建逻辑推理和工具调用路径,将漫无目的的试错转变为定向轨迹生成。最后,我们在这些合成轨迹上训练代理,对工具执行结果采用屏蔽策略。这确保了模型专注于决策逻辑,而不受外部反馈的干扰。实验结果表明,我们的方法在整体质量上优于基于 SOTA 工作流的基线 \textbf{11.91\%}。此外,我们的方法将高质量数据合成的样本效率提高了 \textbf{超过 10$\times$}。

Agentic-Ideation:面向科学构思智能体的样本高效智能体轨迹合成:论文配图
图 1:所提议的 AgenticIdeation 概述包括 Oracle 引导的 Agentic 数据合成和 Agentic 监督微调。该系统利用 Oracle 指导来综合高质量的研究轨迹,随后使用应用于工具执行结果的屏蔽策略来微调模型。