论文

AutoResearch:洞见输入,幻觉剔除

AutoResearch: Insight In, Hallucination Out

应用与实践科学研究

摘要

自主研究系统日益能够执行长程研究工作流,但仅靠自动化并不能保证流程保持科学依据。我们提出 AutoResearch,一个两阶段系统,把想法生成与想法执行连接起来,同时解决研究想法如何形成以及如何通过实验被可靠确立这两个问题。在想法生成阶段,AutoResearch 持续将新兴研究信号与积累的领域知识整合,识别可迁移的机制性洞见,并用多模型生成与交叉评审产出有依据、可检验的研究计划。在想法执行阶段,协作智能体把这些计划分解为实验,迭代实现并诊断实验,并在接受研究结论前执行独立的基于证据的评审。在跨模态检索、系统优化与基准驱动的机器学习等代表性场景中,AutoResearch 将生成的想法转化为可度量进展,检测并纠正不可靠的实验结果,并做出基于证据的决策以继续、修订或终止研究方向。例如,在 RSICD 基准上,AutoResearch 生成的想法将平均 Recall 从 32.84 提升到 34.69,同时仅记录 5 次经审计确认的问题事件,而其他自主研究系统为 11 到 27 次。这些结果展示了一种有意义洞见在实验前被夯实、结论在接受前被夯实的研究流程:洞见输入,幻觉剔除。

AutoResearch:洞见输入,幻觉剔除:论文配图
图3:1024×1024 FP32 矩阵乘法实验的验证。(a) AutoResearch 拒绝一次不稳定的先导运行,诊断出计时错误,并在重跑实验后确立修正后的 3.4 ms 基线。(b) AutoResearch 记录了 4 起经审计确认的问题事件,为所比较的五个自主研究系统中最少。