论文

ProAct:交互环境中的Agentic前瞻

ProAct: Agentic Lookahead in Interactive Environments

模型训练强化学习RLVRAgentic RL

摘要

现有大语言模型(LLM)智能体在需要长程规划的交互环境中表现不佳,主要原因是在模拟未来状态时误差不断累积。为解决这一问题,我们提出ProAct,一个通过两阶段训练范式让智能体内化准确前瞻推理的框架。首先,我们提出有依据的前瞻蒸馏(Grounded LookAhead Distillation,GLAD),让智能体在源自环境搜索的轨迹上进行监督微调。通过将复杂搜索树压缩为简洁的因果推理链,智能体学会前瞻的逻辑,而无需承担推理时搜索的计算开销。其次,为进一步提升决策精度,我们提出蒙特卡洛评论家(Monte-Carlo Critic,MC-Critic),一个即插即用的辅助价值估计器,旨在增强PPO和GRPO等策略梯度算法。通过利用轻量的环境滚动来校准价值估计,MC-Critic提供低方差信号,促进稳定的策略优化,而无需依赖昂贵的基于模型的价值近似。在随机(如2048)与确定性(如Sokoban)环境上的实验表明,ProAct显著提升规划准确性。值得注意的是,经ProAct训练的4B参数模型胜过所有开源基线,并与最先进的闭源模型相当,同时对未见环境表现出稳健泛化。代码与模型可在https://github.com/GreatX3/ProAct获取。

ProAct:交互环境中的Agentic前瞻
图2:ProAct的总体框架,其分两个阶段运行以内化前瞻推理能力。阶段1:Grounded Lookahead Distillation建立推理范式。它通过环境探测(MCTS)构建高质量的前瞻搜索树,并将这些复杂轨迹蒸馏为压缩的显式推理链。阶段2:基于Monte-Carlo评论家的在线强化学习,使用策略梯度框架(例如PPO或GRPO)提升agent的前瞻推理精度。我们引入一个即插即用的MC-Critic,它通过聚合由轻量级随机策略生成的 M M 条并行轨迹的折扣回报,提供低方差的价值估计。