论文
OpenBioRQ:代理商未解决的生物医学研究问题
OpenBioRQ: Unsolved Biomedical Research Questions for Agents
摘要
工作引用看起来像是证据,但链接解析这一事实并不意味着被引用的论文支持该主张。我发现当前的代理模型很少伪造引用(超过 $99\%$ 解析),但大约 $15.9\%$ 链接到错误的论文。现有的基准测试错过了这种失败模式:当问题有固定的答案键时,模型可以从该键重现预期的来源,而不是独立验证来源是否支持该声明。我介绍了 \textbf{\openbiorq{}},这是一个基于检索的代理基准,涵盖 $12$ 领域的 $12{,}553$ 未解决的生物医学研究问题,将开放问题视为 忠实性 和弃权探针。据我所知,这是第一个将代理设置(模型必须发出多个工具调用)与没有答案的未解决问题相结合的生物医学基准。开放性是根据真实的后续证据而不是模型的参数知识来验证的。难度是经验性的:我将其锚定在三个开放权重参考模型无法回答的问题上,而不是主观硬度标签上。在这个最难的子集中,来自与难度锚点相同谱系的保留模型仅解决了约 17%,而三个独立的前沿代理(Gemini-3-Pro、Opus-4.7、GPT-5.5)跨越了 29-60% 的宽范围。因此,基准测试是困难的、不饱和的(最好的代理仍然有约 33-40\% 的问题未解决),并且跨能力层具有区分性。除了困难之外,我还观察到智能体在最困难的问题上崩溃了,智能体停止使用他们的工具。对于最容易崩溃的模型,完全阻止工具访问几乎不会改变其分数——因此工具在最需要它们的地方停止了回报。冻结的每个问题清单将法官间的一致性从 Spearman 的 0.35 提高到 0.82。