论文
SCOUT:面向超长第一人称视频推理的自检与恢复感知工具思维智能体
SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning
摘要
超长第一人称视频理解需要对分布在数小时乃至数天中的时间稀疏证据进行推理,这对上下文有限、需定位关键视频片段的现有多模态模型构成挑战。尽管Chain-of-Tool-Thought(CoTT)智能体系统支持迭代检索与检查,但由于其僵化的放大(zoom-in)策略缺乏恢复机制,饱受错误传播之苦。在本工作中,我们通过SCOUT(Self-Checking Chain-Of-Tool-thought)应对这些挑战,这是一个恢复感知的agentic框架,引入自适应策略评估中间工具观察结果,并动态权衡利用(放大)与探索(区域切换),实现在极长时间跨度上的稳健多跳推理。然而,训练这类多轮使用工具的智能体仍然困难,因为现有RL方法依赖稀疏的结果级奖励,缺乏对长决策轨迹的监督,导致长程推理的信用分配欠佳。为此,我们提出UPS-GRPO,一种不确定性优先的策略优化方法,将探索集中在高不确定性的工具调用后状态上,同时保持样本效率。我们进一步引入轮级优势分解,将结果奖励与基于工具的时间对齐奖励相结合,以改进信用分配。实验表明,SCOUT在超长第一人称基准上取得最先进结果,同时在较短时程的长视频设置中保持竞争力。
