论文

多模态 AI 智能体的前瞻性规划

Anticipatory Planning for Multimodal AI Agents

模型训练强化学习Agentic RL

摘要

多模态智能体的最新进展改善了计算机使用交互与工具使用,但多数现有系统仍是反应式的,孤立地优化动作,而不对未来状态或长期目标进行推理。这限制了规划的连贯性,使智能体无法可靠地解决高层级、多步骤任务。我们提出 TraceR1,一个两阶段强化学习框架,通过在执行前预测短程轨迹来显式训练前瞻性推理。第一阶段进行轨迹级强化学习,其奖励强制预测动作序列之间的全局一致性。第二阶段应用有据强化微调,利用来自冻结工具智能体的执行反馈来细化步骤级准确性与可执行性。TraceR1 在七个基准上接受评估,涵盖在线计算机使用、离线计算机使用基准以及多模态工具使用推理任务,在规划稳定性、执行鲁棒性与泛化能力上相对反应式及单阶段基线取得显著提升。这些结果表明,前瞻性轨迹推理是构建能够在复杂真实环境中有效推理、规划与行动的多模态智能体的关键原则。

多模态 AI 智能体的前瞻性规划:论文配图
图 1:TraceR1 概述:预期规划和扎实执行。规划模型将用户指令与当前屏幕截图和交互历史记录结合起来,预测未来操作的轨迹,其中工具代理仅执行第一个预测步骤,而后续步骤是未执行的前瞻预测,并为工具代理生成步骤级指令,以完成跨不同 GUI 环境和工具使用平台的任务。