论文

DoGMaTiQ:自动生成用于报告评估的问答块

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

模型评测评测方法与指标

摘要

由于检索增强生成(RAG)系统的广泛采用,对长篇、引用支持的报告的评估最近受到了极大的关注。许多评估框架的核心是使用原子事实或金块来评估报告对底层集合中证明的查询相关信息的覆盖范围。虽然掘金传统上被表示为简短的陈述,但最近的工作已经使用问答(QA)表示,从而实现细粒度的评估,将信息需求(即问题)与满足它的潜在多样化内容(即其答案)分离。基于块的评估的一个持续挑战是需要为测试集合中的每个主题手动策划块集——这是一个费力的过程,很难适应新的信息需求。这一挑战在跨语言环境中尤为严峻,因为信息是在多语言源文档中找到的。因此,我们引入了 DoGMaTiQ,一个用于分三个阶段生成基于 QA 的高质量块集的管道:(1) 基于文档的块块生成,(2) 释义聚类,以及 (3) 基于原则质量标准的块块选择。我们将 DoGMaTiQ 块与 AutoArgue(一种最新的基于块的评估框架)集成,以实现对生成的报告的全自动评估。我们对两个跨语言 TREC 共享任务 NeuCLIR 和 RAGTIME 进行了广泛的实验,结果显示与人机交互和完全手动判断都具有很强的排名相关性。最后,对我们的流程的详细分析表明,强大的 LLM 块生成器是关键,并且 DoGMaTiQ 引起的系统排名对于异常系统来说是稳健的。我们通过在 https://github.com/manestay/dogmatiq 公开发布我们的代码和工件来促进未来报告评估的研究。