论文

从多模态源构建面向科学策展的智能体测试架

Building Agent Harnesses for Scientific Curation from Multimodal Sources

智能体系统Agent Harness

摘要

科学发现工作流常依赖来自文献的结构化策展。这对当前智能体很困难——因为关键证据散布于长文本、稠密表格与图中——且最终记录常需要跨多个证据片段推理——而非复制单一片段。我们研究来自多模态源的科学策展——并介绍Beaver——从科学论文抽取结构化信息同时保留对支撑证据溯源的智能体测试架。Beaver组合前沿智能体与多模态证据工具、任务脚手架与工件锚定的自研究。这些组件把策展转为分阶段、可审计的工作流——并启用迭代的评估-诊断-修订循环——持久运行工件暴露阶段定位的失败并指导测试架更新。实验表明Beaver在金参照属性分数(GRAS,与金策展记录一致的属性级度量)上达81.0——超越前沿智能体超过23个绝对点。消融显示任务脚手架、多模态证据工具与溯源踪迹各自都有实质贡献——属性级分析显示在需要跨模态推理与规范化的高价值属性上增益最大。这些结果表明:对来自带多模态证据论文的科学策展——测试架设计是智能体性能的核心决定因素。

从多模态源构建面向科学策展的智能体测试架:论文配图
图 4:主要基线的属性级别得分比较。行是线束,列是显示的评分属性,深绿色单元格表示更强的属性级性能。