论文

Omni-DuplexEval:评估实时双工全模式交互

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

模型评测基准与评测资源

摘要

实时双工交互对于在现实场景中运行的多模式人工智能系统至关重要,其中模型必须持续处理流输入并在适当的时刻做出响应。然而,大多数现有的多模态 大语言模型 (MLLM) 都是在离线设置中进行评估的,其中在生成任何响应之前会处理整个视频输入。虽然最近的工作已经开始探索实时双工 MLLM,但仍然没有针对此设置的全面基准或自动评估方法。为了解决这一差距,我们提出了 Omni-DuplexEval,这是一个系统评估实时双工交互的基准。该基准由两个互补的场景组成:(1) 实时描述,评估生成连续、时间一致的响应以跟踪不断变化的多模式输入的能力;(2) 主动提醒,评估识别显着事件并在适当时刻做出响应的能力。 Omni-DuplexEval 包含 660 个视频,带有细粒度、人工注释的标签和精确的时间元数据,涵盖基于现实场景的 9 项任务,其中所有问题都被制定为开放式查询。我们进一步引入了基于 LLM-as-a-Judge 的自动评估框架,该框架通过时间戳感知和顺序推理联合评估响应内容对齐和响应时间来实现系统评估,实现与人类判断的强一致性。对最先进的双相 MLLM 进行的实验揭示了其巨大的局限性。表现最好的模型总体得分仅为 39.6%,而主动提醒得分仅为 20.0%。我们的分析确定了两个关键挑战:模型难以平衡及时响应与连贯、整体的内容生成,并且它们通常无法确定何时响应以及生成什么内容。我们希望我们的工作能够促进 MLLM 取得进一步进展。