论文

评估 大语言模型 会议中收件人、轮换和下一位发言者预测的能力

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

模型评测模型能力评测

摘要

我们使用 大语言模型 (LLM) 研究多模式多方对话中的轮流。我们为三个任务构建了一个评估框架:收件人检测、轮换预测和下一个发言者预测。我们比较了针对这些任务训练的监督模型、基于文本的 LLM、多模态 LLM (MM-LLM) 和人类受试者。 AMI 语料库上的实验表明,LLM 在下一个说话者预测方面优于监督模型和人类,尽管没有接受目标领域的训练并且无法访问音频或视觉信息。 MM-LLM 在收件人检测和回合变化预测方面比基于文本的 LLM 表现更好,但仍低于人类表现,表明难以利用原始视听信号。消融分析表明,对话上下文至关重要,特别是对于下一个说话者的预测。我们观察到人类和 LLM 的预测模式相似,并且频繁变化的区间对两者来说都是困难的。