论文

全方位需求理解:多模态交互中上下文用户意图推理的基准

Omni Demand Understanding: A Benchmark for Contextual User-Intent Inference in Multimodal Interaction

模型评测基准与评测资源

摘要

自然视听交互正在成为人工智能助手的重要界面,允许用户通过语音和视觉进行交流,而不是精心编写的文本提示。然而,现有的交互能力基准仍然主要关注响应质量,而没有充分探索一个更基本的问题:模型能否从复杂的多模态交互中正确推断用户的潜在需求?现实世界的用户需求通常在语音中未明确说明,必须从多模态线索和对话历史中推断出来。由于含糊或不流畅的表达以及嘈杂的声学环境,这一推论变得更加复杂。相反,类似请求的语音可能并不构成对助理的要求,从而导致错误触发。我们将全方位需求理解(ODU)建立为一个独特的多模态上下文推理问题:给定交互流,模型必须检测用户需求是否存在,并从多模态和会话上下文中推断意图。 ODU从五个维度评估这种能力,涵盖单轮和多轮交互。我们使用挑战驱动的分类法、分类法引导的代理视频生成和人工记录的交互来构建 ODU-Bench,然后进行基于媒体的注释和人工验证。我们评估了 14 个本地 MLLM。即使是最强的 Gemini 3.1 Pro,也只能恢复 44.7% 的关键信息,这些信息必须从视觉、听觉或对话上下文中推断出来。此外,14个模型中有11个模型在非需求场景下的误触发率超过50%。这些结果揭示了当前 MLLM 推断上下文用户需求的能力存在系统性能力差距。我们希望ODU能够对多模态交互中先前未被充分探索但必不可少的能力进行评估:在生成适当的响应之前正确理解用户需求。