论文
在 QMSum 上进行高效的以查询为中心的会议摘要的检索跨度训练
Retrieved-Span Training for Efficient Query-Focused Meeting Summarization on QMSum
摘要
QMSum 不提供评分器,使得以查询为中心的会议摘要结果难以比较。我们在一次实施中重新评分或生成 15 个系统。通过通用推理端口,当从上限长输入转移到 2,000 字检索范围时,已发布的 406M Fusion-in-Decoder 专家会损失 6.30 ROUGE-1。在这个跨度范围内对其进行微调可以恢复损失。测试中,它的 ROUGE-1 得分为 36.33,而我们的 1.2B 系统得分为 35.41;会议集群 95% 的差异间隔为 [-0.27, +2.22],因此 QMSum 不会在统计上将它们分开。较小的系统使用大约三分之一的总参数和不到一半的峰值推理内存。在固定的 1.2B 基础内,跨度机制微调增加了 5.29 [+4.02,+6.56],同时用 2,000 个检索到的单词替换前 4,500 个转录单词,在测试中增加了 1.55,在验证中增加了 0.29。另外,在一个简洁的提示和参考重叠评分器下,发布的 406M 专家超过了五个专有托管模型至少 6.2 ROUGE-1,但输出长度和缺乏人为或事实评估限制了这一排序。结论仅限于 QMSum 和自动指标。