论文

为面向科学的agentic AI注入分析严谨性:神经影像数据分析平台Brain Researcher

Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis

应用与实践智能体系统Agent Harness科学研究

摘要

AI智能体可以执行科学分析,但只有在权衡过备选方案、并把论断限定在证据支持的范围内之后,一个分析结果才能成为可辩护的论断。智能体可能重现多种失败模式,包括选择性分析、过早宣告成功以及对不完善指标的过度优化。我们提出 Brain Researcher,一个在神经影像研究者的计算环境中运行、遵循关于可采纳分析、必需检查和论断范围规则的agentic研究框架。在基准测试中,Brain Researcher 将七个模型的首选工具选择准确率提高了 70.2 个百分点(无它时为 23.3%,有它时为 93.6%),可验证的依据性从 4.6% 提升到 22.0%。在协作者主导和自我演化的研究中,多宇宙分析暴露了分析选择的敏感性,科学评审将论断分类为接受、有保留、修订、阻止、拒绝或推迟。通过将决策与证据和来源绑定,Brain Researcher 把方法论判断嵌入工作流之中,而非置于其后。

为面向科学的agentic AI注入分析严谨性:神经影像数据分析平台Brain Researcher:论文配图
图1:Brain Researcher:面向可审计神经影像研究的工作区中心基础设施。Brain Researcher运行在研究者现有的计算环境中,将神经影像分析呈现为结构化、可审计的操作:每个选择、检查和输入都在发生时被记录,从而使已完成的分析形成一份冻结的记录,可由运行者以外的人读取和审计,而无需重新执行。(a)工具生态:用于预处理、建模、元分析、机器学习、质量控制和报告的成熟神经影像软件,每个软件由一份机器可读规范表示,并在版本固定的容器中执行。(b)每份规范声明其输入、输出、参数、版本、证据锚点和验证规则;规则检查器在每次提议的调用运行之前对照这些条款进行检验,并记录哪些条款通过或未通过。(c)回合工作流:研究者在提交门处提出问题并批准计划,有效动作被分派到版本固定的执行器,由此产生的审计包——包含已提交的计划、工具版本、查阅过的证据、产物、日志、溯源以及每个论断所通过的检查——流入审查层,审查层将带有条件标签的论断写回记忆。正是这一审计包使分析可被审计:一次完成的运行是一个完全可检查的研究对象,而非一次性的结果,并导出为紧凑的论断卡片,审阅者可以逐字段重新打开查看。方法论上的判断仍属于研究者本人;系统使其在每个阶段可见。