论文
AI科学家的上限是证据:药物资产估值中专有数据与推理技能的分层消融
AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation
摘要
人工智能科学家代理的评估通常被认为能力主要是模型质量、提示或推理支架的函数。我们在药物资产评估中测试了一个不同的假设:对于知识密集型的科学决策,限制因素通常是代理人可以访问的证据基础。我们对生产估值代理进行了受控的三臂消融:A 是纯网络 LLM 分析师,B 添加了公共结构化工具以及 14 维估值手册、验证器、客观性政策和红队,C 添加了专有的 Noah AI 语料库,包括精心策划的管道、试验和交易情报。在 13 项资产分层基准中,B 改进了校准和审计纪律:分级准确度从 0.80 上升到 0.89,客观性从 3.16 上升到 3.30。但B并没有消除事实上的上限。在能力超集会计下,A和B仅恢复了策划黄金竞争记录的0.25和0.38,而C恢复了0.96;在精选的长尾子集上,C 达到 0.93 vs. 0.26/0.30。 A 和 B 的原始盲板决策质量相似(7.01 与 6.96),因此我们引入完整性感知决策效用:知情决策质量 = 决策质量 x 黄金覆盖率。在此指标上,C 达到 7.43,而 A/B 为 1.76/2.57。即使是完美的非专有数据报告,B 的覆盖范围也会限制在 3.83。结果并不是推理支架不重要;而是推理支架不重要。他们提高了校准和纪律。相反,专有证据设定了人工智能科学家可以知道并因此做出决定的上限。
