论文

用于强大视频理解的信心感知工具编排

Confidence-Aware Tool Orchestration for Robust Video Understanding

智能体系统Agent 工具调用

摘要

视频推理语言模型隐含地假设每个输入帧都同样可靠。这导致了我们所说的“盲目信任问题”:在运动模糊、眩光或遮挡等现实扰动下,前沿视频推理模型在现实世界的具体基准上可能会出现 15-30%p 的精度下降,同时仍然没有意识到它们的视觉证据已被降级。为了应对这一挑战,我们提出了 Robust-TO,这是一种代理视频理解框架,它将每帧的可信度明确集成到推理的每个阶段。 Robust-TO 在统一的证据接口下组织异构视觉感知工具。每个工具都会接收从原始问题派生的子查询以及根据可靠性相关性得分选择的一组可信框架。它以共享格式返回证据:具体预测(例如,边界框、运动轨迹、识别的文本或动作标签)、时间定位和校准的可靠性得分。在推理过程中,这些校准分数指导三层综合过程(高/中/低)中的证据权重,并定义置信成本 GRPO 奖励,共同优化正确性、证据可靠性和效率。在涵盖八个任务的两个视频推理基准测试中,Robust-TO 在干净输入上实现了 56.4% 的平均准确率,比最强的开源基线高出 10.6%p,并且优于 Gemini-2.5-Pro (46.2%)。在五种实际的损坏类型下,Robust-TO 保持了 54.3% 的平均准确度,比最强的开源基线高出 5.8%p,同时在所有比较方法中表现出最小的干净到损坏的准确度下降。