论文
评估与守护智能体科学综合中的引用忠实性
Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis
摘要
OpenScholar与PaperQA2等智能体LLM系统阅读科学文献并返回带引用的答案,它们及其基准都已在检查这些引用是否成立——用固定的归因模型或人类评分员。但都没有审计该检查本身的可靠性。我们证明它不可靠且这很重要:在相同的智能体输出上,测得的无支撑引用率仅随验证器严格程度变化就在约3%到约18%之间;尽管验证器对哪些引用有支撑意见一致,它们对标记哪些却不一致(负向特定一致0.27–0.30),因此没有任何单一标记集合可信,且不指名验证器与协议的跨论文比较无效。我们提出金标锚定的评估协议与可部署的守护,使该行为可测量、有界。协议验证验证器、测量重归因,并对照人类金标而非另一个模型的裁决校准保证;验证器是按成本选择的可更换仪器(支撑类召回0.94,留出),重归因是商品化步骤——确定性BM25即匹敌最佳开源生成器。守护加分式共形层:对滑过所选标记规则的真正无支撑引用放置无分布、有限样本的界——这是对捕获率的保证而非对结论正确性的保证。该界在留出金标上成立,我们识别并量化其向部署迁移的条件——校准负例难度——并给出具体的再校准配方(既往共形事实性工作未检验)。在公开基准(SciFact、QASA、PubMedQA)上跨四个27–35B开源模型与三条智能体管线验证,每个头条数字都带置信区间;协议与守护以单GPU开源套件交付。