论文
AI Act评估基准:面向NLP与RAG系统的开放、透明、可复现评估数据集
AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems
摘要
AI在异构的公共与社会部门的快速部署,随之加剧了对监管标准与框架合规的需求。EU AI Act已成为监管格局中的一座里程碑。开发能够探明AI系统对此类标准合规程度的解决方案,常常受限于资源匮乏,阻碍了对系统性能的半自动或自动化评估。这产生了对手工工作的需求,而手工工作往往容易出错、资源受限,或仅限于法规未能清晰描述的案例。本文提出一种开放、透明且可复现的资源构建方法,用于促进NLP模型评估,并重点关注RAG系统。我们构建了一个数据集,包含针对EU AI Act的风险等级分类、条款检索、义务生成与问答任务。数据集文件采用适合机器对机器的格式。为生成这些文件,我们以领域知识作为释法(exegetical)依据,结合大语言模型的处理与推理能力来生成场景及相应任务。我们的方法展示了一种利用语言模型进行具有高文档相关性的有据生成的方式。此外,我们克服了一些局限,例如处理EU AI Act中未明确定义的风险等级决策边界,如有限(limited)与最小(minimal)风险案例。最后,我们通过评估一个基于RAG的解决方案来展示数据集的有效性,该方案在禁止(prohibited)与高风险场景上分别达到0.87与0.85的F1分数。
