论文
科学检索Agent失败的地方:暴露和检查尝试的决策检查点审核
Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts
摘要
最终答案的准确性并不能揭示科学检索Agent是否未能遇到目标论文、尝试检查它或在检查后返回可接受的答案。我们引入决策检查点,在推理过程中记录观察结果和工具操作,而无需基准标签,然后加入目标身份和评估者标签以分配记录事件的结果类别。在固定、目标丰富的环境中,针对 540 个可回答的 AutoResearchBench 深度问题的五个条件,关键词搜索的准确率达到 24.6%,而原始搜索的准确率仅为 17.8%。关键字条件在没有目标曝光和检查的情况下错误答案较少,但在目标曝光且未检查后错误答案较多。与关键字搜索相比,先读的证据搜索调用记录多了 27.4%。目标检查尝试针对先读下的 199 个问题和关键词搜索下的 191 个问题进行;两种条件都达到 24.6% 的准确度。检查点协议使这些问题级别的差异变得明确,将目标暴露和检查与总体准确性和总体工具使用区分开来。