论文
DeepFact:面向深度研究事实性的基准与Agent共同演化
DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
摘要
搜索增强的LLM Agent可以生成深度研究报告(DRR),但验证声明级事实性仍然困难。现有事实核查器主要面向通用领域、事实型的原子声明,且没有基准测试此类验证器能否迁移到DRR。然而,构建这样的基准本身就很困难。我们首先表明,静态专家标注基准在这种设置下是脆弱的:在一项由博士级专家参与的受控研究中,无辅助专家在一个可验证声明的隐藏微型金标集上仅达到60.8%的准确率。我们提出基于先审计后评分(Audit-then-Score,AtS)的演化基准构建:基准标签和理由是显式可修订的——当验证器与当前基准不一致时,它必须提交证据;审计员裁决争议;被接受的修订会在模型评分前更新基准。经过四轮AtS,专家微型金标准确率升至90.9%,表明专家作为审计员远比作为一次性标注者可靠。我们将AtS实例化为DeepFact-Bench——一个带可审计理由的版本化DRR事实性基准,以及DeepFact-Eval——一个文档级验证Agent(含分组lite变体),它在DeepFact-Bench上优于现有验证器,并能良好迁移到外部事实性数据集。
