论文

SCOUT:面向超长第一人称视频推理的自检与恢复感知工具思维智能体

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

模型训练强化学习RLVRAgentic RL

摘要

超长第一人称视频理解需要对分布在数小时乃至数天中的时间稀疏证据进行推理,这对上下文有限、需定位关键视频片段的现有多模态模型构成挑战。尽管Chain-of-Tool-Thought(CoTT)智能体系统支持迭代检索与检查,但由于其僵化的放大(zoom-in)策略缺乏恢复机制,饱受错误传播之苦。在本工作中,我们通过SCOUT(Self-Checking Chain-Of-Tool-thought)应对这些挑战,这是一个恢复感知的agentic框架,引入自适应策略评估中间工具观察结果,并动态权衡利用(放大)与探索(区域切换),实现在极长时间跨度上的稳健多跳推理。然而,训练这类多轮使用工具的智能体仍然困难,因为现有RL方法依赖稀疏的结果级奖励,缺乏对长决策轨迹的监督,导致长程推理的信用分配欠佳。为此,我们提出UPS-GRPO,一种不确定性优先的策略优化方法,将探索集中在高不确定性的工具调用后状态上,同时保持样本效率。我们进一步引入轮级优势分解,将结果奖励与基于工具的时间对齐奖励相结合,以改进信用分配。实验表明,SCOUT在超长第一人称基准上取得最先进结果,同时在较短时程的长视频设置中保持竞争力。

SCOUT:面向超长第一人称视频推理的自检与恢复感知工具思维智能体:论文配图
图1:面向超长视频推理的时序搜索策略比较。上:MLLM均匀采样以获取初始视觉观察。中:现有智能体工具模型因早期不可逆承诺和单调放大而搜索失败。下:我们的SCOUT恢复感知方案,动态切换策略以定位答案关键帧。