论文
多模态 AI 智能体的前瞻性规划
Anticipatory Planning for Multimodal AI Agents
摘要
多模态智能体的最新进展改善了计算机使用交互与工具使用,但多数现有系统仍是反应式的,孤立地优化动作,而不对未来状态或长期目标进行推理。这限制了规划的连贯性,使智能体无法可靠地解决高层级、多步骤任务。我们提出 TraceR1,一个两阶段强化学习框架,通过在执行前预测短程轨迹来显式训练前瞻性推理。第一阶段进行轨迹级强化学习,其奖励强制预测动作序列之间的全局一致性。第二阶段应用有据强化微调,利用来自冻结工具智能体的执行反馈来细化步骤级准确性与可执行性。TraceR1 在七个基准上接受评估,涵盖在线计算机使用、离线计算机使用基准以及多模态工具使用推理任务,在规划稳定性、执行鲁棒性与泛化能力上相对反应式及单阶段基线取得显著提升。这些结果表明,前瞻性轨迹推理是构建能够在复杂真实环境中有效推理、规划与行动的多模态智能体的关键原则。
