论文

用可复用的跨领域流水线评估AI会议摘要

Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline

模型评测评测方法与指标

摘要

我们为生成式人工智能应用程序提供了一个可重用的评估管道,为人工智能会议摘要进行实例化,并与从数据集管道派生的公共工件包一起发布。该系统将可重用编排与特定于任务的语义分为五个阶段:源引入、结构化参考构建、候选生成、结构化评分和报告。与独立的索赔评分器不同,它将事实真相和评估器输出视为类型化、持久化的工件,从而实现聚合、问题分析和统计测试。我们在包含 city_council、private_data 和 Whitehouse_press_briefings 的 114 个会议的类型化数据集上对离线循环进行基准测试,在 gpt-4.1-mini、gpt-5-mini 和 gpt-5.1 上生成 340 个会议模型对和 680 个法官运行。在此协议下,gpt-4.1-mini 实现了最高的平均准确度(0.583),而 gpt-5.1 在完整性(0.886)和覆盖率(0.942)方面领先。与 Holm 校正的配对符号测试显示没有显着的准确度获胜者,但证实了 gpt-5.1 的显着保留增益。类型化的 DeepEval 对比基线保留了保留顺序,但报告了更高的整体准确性,这表明基于参考的评分可能会忽略基于声明的评估捕获的不受支持的具体错误。类型化分析将 Whitehouse_press_briefings 识别为一个具有准确性挑战的域,并且经常出现不受支持的细节。部署后续行动显示 gpt-5.4 在所有指标上都优于 gpt-4.1,在相同协议下的保留指标方面具有统计上的强劲增长。该系统对离线循环进行基准测试并记录在线反馈到评估路径,但不进行定量评估。