论文
InteractionBench:流式视频系统的实时交互基准
InteractionBench: A Real-Time Interaction Benchmark for Streaming Video Systems
摘要
当视频助理的指令需要回应时,视频助理必须说话,否则保持沉默。我们引入了一个基准来评估整个模型系统、记忆和响应控制器的这一决策。 InteractionBench 涵盖了 812 个视频中 1,060 次交互的查询响应、事件触发器和持续更新,其中有 69 个负样本流和 53 个套件,将计数事件与相似的未遂事件配对。它对视频时钟的内容准确性、计时准确性和静音合规性进行评分。不同系统中,及时响应往往以降低沉默合规性为代价。轮询的 Qwen3-VL-8B 的计时精度达到 77.8,但静音合规性达到 10.9。本机实时交互系统以 66.8 的计时精度达到 29.2 的静音合规性,但仍在 89.9% 的负样本流中发出响应。没有开放权重系统通过三分之一的近似事件测试组。只有有选择地减少回复才有帮助,因为随机删除只是用时间换取沉默。离线分数会忽略这些失败并错误预测在线行为。添加限制的成本很高,因为本机系统的控制器本身添加的很少,而 Agentic 系统只有付出每次轮询约 30 秒的代价,才能增加这种克制能力。项目页面:https://www.enxinsong.com/projects/interactionbench/ 代码:https://github.com/Espere-1119-Song/InteractionBench 数据:https://huggingface.co/datasets/InteractionBench/InteractionBench