论文

何时重新承诺:面向长程视觉语言推理的时间抽象发现

When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning

智能体系统Agent 规划

摘要

长程推理不仅需要决定采取什么动作,还需要决定在下一次观测之前承诺多深。我们将其形式化为承诺深度(commitment depth):在两次重规划之间开环执行的原始动作数量。承诺深度带来重规划成本与累积执行误差之间的权衡,但大多数现有长程系统将其固定为手工设计的标量。在这项工作中,我们转而将承诺深度视为策略本身的一个可学习、依状态而定的变量。我们在一个模型原生的视觉-语言策略中实例化这一思想,该策略联合预测执行什么以及执行多久。在Sliding Puzzle和Sokoban上,所得自适应策略帕累托优于每一个非退化的固定深度基线,解决率最多高出12.5个百分点,同时每回合使用的原始动作约减少25%。尽管仅使用7B骨干,我们的方法在两个任务上都优于GPT-5.5和Claude Sonnet,而所有受测的开源权重视觉-语言模型零样本成功率均为0%。我们进一步给出理论分析,表明在标准的承诺深度代理指标下,只要局部最优深度随状态变化,依状态的承诺就严格优于任何固定深度。

何时重新承诺:面向长程视觉语言推理的时间抽象发现:论文配图
图 8:数据生成和收集的详细流程。对于每个情节,都会初始化可重现且可配置的随机环境和选定的收集器代理。代理预测开环执行的承诺,并通过单独的渲染器渲染下一个状态以进行预测。所有承诺和状态都会被保存,并与基于地面实况信号的启发式求解器进行比较。