论文

DeepFact:面向深度研究事实性的基准与Agent共同演化

DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality

模型评测评测方法与指标

摘要

搜索增强的LLM Agent可以生成深度研究报告(DRR),但验证声明级事实性仍然困难。现有事实核查器主要面向通用领域、事实型的原子声明,且没有基准测试此类验证器能否迁移到DRR。然而,构建这样的基准本身就很困难。我们首先表明,静态专家标注基准在这种设置下是脆弱的:在一项由博士级专家参与的受控研究中,无辅助专家在一个可验证声明的隐藏微型金标集上仅达到60.8%的准确率。我们提出基于先审计后评分(Audit-then-Score,AtS)的演化基准构建:基准标签和理由是显式可修订的——当验证器与当前基准不一致时,它必须提交证据;审计员裁决争议;被接受的修订会在模型评分前更新基准。经过四轮AtS,专家微型金标准确率升至90.9%,表明专家作为审计员远比作为一次性标注者可靠。我们将AtS实例化为DeepFact-Bench——一个带可审计理由的版本化DRR事实性基准,以及DeepFact-Eval——一个文档级验证Agent(含分组lite变体),它在DeepFact-Bench上优于现有验证器,并能良好迁移到外部事实性数据集。

DeepFact:面向深度研究事实性的基准与Agent共同演化
图1:通过先审计后评分(Audit-then-Score, AtS)实现演化式基准测试。左:AtS工作流。右:一个演化基准的示例。与传统静态基准测试不同,AtS将真值 y i ( t ) y_{i}^{(t)} 视为一个演化的共识。该过程分四个阶段进行:(1) 评估:在当前基准状态( B t B_{t} )上运行一个挑战者(Challenger)智能体( M t M_{t} ),产生判定 y ^ i \hat{y}_{i} 。(2) 挑战:当 y ^ i ≠ y i ( t ) \hat{y}_{i}\neq y_{i}^{(t)} 时,挑战者提交带证据的提案。(3) 审计:由审计者(人类专家或可信智能体)裁决争议;若挑战者的论证强于现行依据,则接受该更新。(4) 演化与评分:被接受的更新产生下一个基准状态( B t + 1 B_{t+1} );随后依据这一精炼后的真值对挑战者评分。