论文
SayNext-Bench:为什么大语言模型在下一个话语预测方面遇到困难?
SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Prediction?
摘要
我们探索使用大语言模型(LLM)来预测人类对话中的下一个话语。尽管大语言模型最近取得的进展证明了它们与用户进行自然对话的能力,但我们发现,即使是领先的模型也难以预测人类说话者的下一句话。相反,人类可以根据上下文中的手势、目光和情绪语气等多模态线索轻松预测即将发生的话语。为了系统地检验大语言模型是否可以重现这种能力,我们提出了 SayNext-Bench,这是一个评估大语言模型和多模态大语言模型(MLLM)的基准,以预测跨越各种现实场景的多模态线索的上下文条件响应。为了支持这一基准,我们构建了 SayNext-PC,这是一个新颖的大规模数据集,其中包含具有丰富多模态线索的对话。在此基础上,我们进一步开发了一种双路由预测 MLLM SayNext-Chat,它结合了认知启发设计来模拟对话中的预测处理。实验结果表明,我们的模型在词汇重叠、语义相似性和情感一致性方面优于最先进的 MLLM。我们的结果证明了利用多模态线索的 LLM 进行下一个话语预测的可行性,并强调了(i)多模态线索不可或缺的作用和(ii)主动预测处理作为自然人类交互的基础,而这在当前的 MLLM 中是缺失的。我们希望这一探索为以人为中心的人工智能提供一个新的研究入口,以实现更加人性化、上下文敏感的人工智能交互。我们的基准和模型可以在 https://saynext.github.io/ 访问。
