论文
OmniAssistBench:Omni-LLM 的助手式交互基准
OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
摘要
最近的全模态 大语言模型 (Omni-LLM) 显示出作为实时视频助手的巨大潜力,它可以持续感知环境并引导用户实现特定目标。与传统的被动视频理解不同,交互式助手应该主动结合视觉状态、用户目标和先验知识来提供有效的帮助。评估这一点相当具有挑战性,因为模型不可预测的响应会动态改变用户的后续操作,而静态离线数据集无法适应这一点。为了解决这个瓶颈,我们引入了 OmniAssistBench。为了解决可以通过各种方法实现相同用户目标的不同交互路径的问题,我们提供了具有从源视频派生的预定义先验的模型,要求它们引导用户沿着完全相同的路线前进。由于真正的交互视频很少见,我们通过对现有互联网视频进行逆向工程来构建数据集。我们推断逻辑用户目标并将视频分割成多轮剪辑以模拟连续交互。这个严格的流程需要 1000 多个专家工时来构建数据集。结果显示,专有的 Gemini-3-Pro 在最高分 100 分中达到了 66.4,而开源 Qwen3-Omni-Instruct 则达到了 51.2。尽管当前模型通常能够理解用户输入,但它们经常提供不正确或不完整的答案。具体来说,他们难以应对视觉提示(例如手势),无法在多轮交互期间维持历史背景,并且无法将响应延迟到目标事件。结果表明,在模型成为可靠的助手之前,还有很大的改进空间。