论文

VERITAS:用于可验证的图像衍生假设检验的多智能体联合科学家

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing

智能体系统Agent 协作

摘要

基于多模式临床数据(包括医学成像)的科学研究需要协调临床、放射学、编程和生物统计专业知识,这是一个阻碍发现的支离破碎的过程。我们推出了 VERITAS(通过代理系统进行图像衍生假设测试的可验证认知推理),这是一个临床联合科学家:一个多代理系统,可以自主测试自然语言假设并生成完全可审计的证据跟踪,通过从分析计划到分段掩码到统计代码到最终裁决的可执行输出来跟踪每个结论。与之前主要对表格或文本数据进行操作的人工智能科学家系统不同,VERITAS 直接在医学图像中进行自主发现。它将工作流程分解为由角色专门代理处理的四个阶段,并引入了认知证据标签框架,通过联合评估重要性、效果方向和研究功效,将结果机械地分类为支持、反驳、动力不足或无效。这种区别在医学成像中至关重要,其中不显着的结果通常反映样本量不足而不是缺乏影响。我们构建了一个包含 64 个假设的分层基准,跨越心脏和脑胶质瘤 MRI 数据集的六个复杂程度。 VERITAS 使用前沿模型达到 81.4% 的判定准确率,使用本地托管的开放权重模型 (8-30B) 达到 71.2%,在两个类别中均优于所有单模型基线。它还产生最高比例的独立可验证统计输出(86.6%),因此即使其故障仍然可以通过工件检查进行诊断。因此,结构化多智能体分解取代了模型规模,同时保留了科学发现所需的可验证性。我们在 https://github.com/LucZot/veritas 发布了代码、假设库和评估管道。