论文
ProactiveBench:流视频模型真的能像人类一样交互吗?
ProactiveBench: Can Streaming Video Models Really Interact Like Humans?
摘要
流视频理解需要模型处理连续的多模态输入,同时保持时间上下文。现有的评估主要是反应性的:它们在选定的时间戳查询模型,因此不评估模型何时应响应。相反,主动交互需要监视长期请求,在目标事件发生后在适当的时间间隔内做出响应,否则保持沉默。我们引入了 ProactiveBench,它以一秒的流间隔评估模型,而无需明确的响应提示。它的六个子任务因触发模糊性和时序容错性而异。事件灵敏度以几何方式结合了同一录音的响应率和静音率;四个基于窗口的子任务区分早期响应、窗口内响应和错过响应;和重复计数惩罚遗漏和重复。在六个评估系统中,有四个系统的过早响应数量超过了错过响应数量,这揭示了类人交互所需的时间决策存在巨大差距。