论文

IPIBench:评估连续流下 MLLM 的交互式主动智能

IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams

模型评测基准与评测资源

摘要

最近的多模态 大语言模型 (MLLM) 在反应式问答方面取得了出色的性能,但现实世界的流媒体助手需要对连续视觉输入进行主动推理。现有的基准主要研究孤立的单轮设置中的被动或主动交互,忽略了动态多轮场景,在动态多轮场景中,用户可以添加、修改或取消主动请求以及交错的被动查询。为了弥补这一差距,我们推出了 IPIBench,这是第一个在流视频设置下评估 MLLM 交互式主动智能的基准。 IPIBench 涵盖主动监控、主动任务管理和交错的反应主动请求。对代表性 MLLM 的评估揭示了两个主要局限性:不稳定的主动触发以及反应性和主动性行为之间的协调性较弱。我们进一步提出了 IPI-Agent,一种 无需训练 代理框架,具有交互控制策略和时间门控机制,用于稳定主动触发和协调多轮交互。实验表明,IPI-Agent 在所有基准设置上持续改进现有 MLLM。