论文

专业领域的基准构建和评估框架:国防相关文件案例研究

A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents

模型评测基准与评测资源

摘要

专业领域中基于 RAG 的问答 (QA) 面临冷启动问题:缺乏评估基准和 后训练 的标记数据。我们提出了 DoRA(面向领域的 RAG 评估),这是一种新颖的基准构建和评估框架,仅使用一小部分专业领域文档。 DoRA 系统地生成综合 QA 训练和评估数据集,其中包含五个特定领域意图的可审计证据。为了减轻同一管道的循环性,DoRA 的训练和测试拆分使用从不相交的种子文档语料库中提取的不同 LLM 系列(用于训练的 Claude Sonnet;用于测试的 GPT-4o)。 DoRA 在 40 个国防相关文档(用英文编写)上进行实例化,生成约 6,600 个精选实例。与 1,259 个样本的基准上的 8 个 LLM 基线相比,在合成训练集上训练的 LoRA 适应的 Llama3.1-8B 持续提高了 6 个覆盖率和 忠实性 指标的性能,特别是在默认 GTE 检索设置下将幻觉减少了一半以上,并且在替代 检索器 和基于提示的基线中持续获得收益。防御领域的专业知识被纳入我们评估的三个阶段:(a) 确定 DoRA 生成的综合 QA 的质量,(b) 确定 LLM 作为评判分数的可靠性,以及 (c) 在完全由人工编写的 QA 示例上评估 QA 管道的泛化性。我们将 DoRA 定位为领域转移下专业领域 RAG 的实用框架,并将防御作为高风险案例研究。