论文
EviGraph:证据引导的自主研究Agent
EviGraph: Evidence-Guided Autonomous Research Agents
摘要
自主研究代理可以生成假设、执行实验并草拟文献,但其输出常常包含未经证实的主张和研究问题、实验、结果与结论之间的不一致性。我们认为这一问题部分是由于架构设计造成的:现有的系统将研究组织成顺序管道,但在不同阶段并未明确维护或验证演变中的证据结构。在这篇文章中,我们介绍了EviGraph,一种自主研究框架,它将研究过程表示为包含问题、缺口、假设、实验、发现和主张节点的类型化证据图。该图作为代理的操作状态,而不是事后记录。EviGraph检查证据链中的缺失依赖、语义不一致性和结果-主张不一致性,并定位最弱的节点,然后重新生成受影响的下游子图。图的存盘防止失败修复导致先前验证的证据被破坏。只有在保留的所有主张都被基于验证证据链的基础后,文献才生成。在ARC-Bench-ML和NanoResearch-20上进行的实验表明,EviGraph在整体研究性能方面优于与端到端研究代理基准相比的其他研究代理,在强基准基础上提高了40.19%的Claim支持率,并达到了87.73%的实验数据一致性。这些结果展示了明确证据状态维护对于可靠自主研究的价值。
