论文

AI科学家的上限是证据:药物资产估值中专有数据与推理技能的分层消融

AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation

智能体系统Agent任务评测

摘要

人工智能科学家代理的评估通常被认为能力主要是模型质量、提示或推理支架的函数。我们在药物资产评估中测试了一个不同的假设:对于知识密集型的科学决策,限制因素通常是代理人可以访问的证据基础。我们对生产估值代理进行了受控的三臂消融:A 是纯网络 LLM 分析师,B 添加了公共结构化工具以及 14 维估值手册、验证器、客观性政策和红队,C 添加了专有的 Noah AI 语料库,包括精心策划的管道、试验和交易情报。在 13 项资产分层基准中,B 改进了校准和审计纪律:分级准确度从 0.80 上升到 0.89,客观性从 3.16 上升到 3.30。但B并没有消除事实上的上限。在能力超集会计下,A和B仅恢复了策划黄金竞争记录的0.25和0.38,而C恢复了0.96;在精选的长尾子集上,C 达到 0.93 vs. 0.26/0.30。 A 和 B 的原始盲板决策质量相似(7.01 与 6.96),因此我们引入完整性感知决策效用:知情决策质量 = 决策质量 x 黄金覆盖率。在此指标上,C 达到 7.43,而 A/B 为 1.76/2.57。即使是完美的非专有数据报告,B 的覆盖范围也会限制在 3.83。结果并不是推理支架不重要;而是推理支架不重要。他们提高了校准和纪律。相反,专有证据设定了人工智能科学家可以知道并因此做出决定的上限。

AI科学家的上限是证据:药物资产估值中专有数据与推理技能的分层消融:论文配图
图 1:总体证据和决策指标的 A/B/C(总体而言,标准化为 0-1:客观性/4,决策质量/10)。 B 的技能/公共工具提高了层级正确性并适度提高了客观性;数据 (C) 主导覆盖范围和知情决策质量; B 的判决健全性与 A 类似(知情决策 Q B ≈\approx A)。