论文
OmniInteract:实时全模式助理的真实世界流媒体交互基准测试
OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants
摘要
我们介绍 OmniInteract,这是一种实时全模式 大语言模型 的流基准,通过视听流的本机在线推理进行评估。与离线视频理解或文本提示的流 QA 不同,OmniInteract 保留原始视听流,并需要模型在线处理它,而无需访问未来的内容。用户查询和环境声音嵌入到音轨中,要求模型检测多模式触发器,决定何时响应,并在流展开时进行回答。 OmniInteract 包含 250 个视频,其中包含 1,430 个临时响应槽:跨实时、主动和嵌套场景的 1,062 个 1Q1A 槽,以及用于连续任务监控和步骤指导的 368 个 1QnA 槽。每个槽包括一个触发器、响应窗口和目标答案。我们使用交互感知质量及时性 F1、中断诊断套件和嵌套链完成分数来评估响应的正确性、时序、无效输出、中断处理和上下文连续性。实验表明,当前模型在流交互方面仍然较弱,最好的整体 IA-QTF1 仅达到 0.368,最好的 1QnA IA-QTF1 仅达到 0.052。对全双工设置中数学推理的进一步研究表明,离线能力不一定会转移到在线交互。代码和数据集将在 https://github.com/Lucky-Lance/OmniInteract 上公开访问。