论文
重新思考会议有效性:时间细粒度自动会议有效性评估的基准和框架
Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation
摘要
评估会议效果对于提高组织生产力至关重要。当前的方法依赖于事后调查,为整个会议生成单一的粗粒度分数。对手动评估的依赖本质上在可扩展性、成本和可重复性方面受到限制。此外,单一分数无法捕捉协作讨论的动态本质。我们提出了一种以新标准和时间细粒度方法为中心的评估会议有效性的新范式。我们将有效性定义为随着时间的推移实现目标的比率,并针对会议中的各个主题部分对其进行评估。为了支持此任务,我们引入了 AMI 会议有效性 (AMI-ME) 数据集,这是一个新的元评估数据集,包含来自 130 个 AMI 语料库会议的 2,459 个人工注释片段。我们还开发了一个自动有效性评估框架,该框架使用 大语言模型 (LLM) 作为法官,对每个部分相对于总体会议目标的有效性进行评分。通过大量实验,我们为这项新任务建立了全面的基准,并评估了该框架在不同会议类型(从业务场景到非结构化讨论)中的通用性。此外,我们从原始语音开始对端到端性能进行基准测试,以衡量整个系统的功能。我们的结果验证了该框架的有效性,并为促进会议分析和多方对话的未来研究提供了强有力的基线。我们的数据集和代码将公开。 AMI-ME 数据集和自动评估框架可在以下网址获取:此 URL。