论文
ProAct:交互环境中的Agentic前瞻
ProAct: Agentic Lookahead in Interactive Environments
摘要
现有大语言模型(LLM)智能体在需要长程规划的交互环境中表现不佳,主要原因是在模拟未来状态时误差不断累积。为解决这一问题,我们提出ProAct,一个通过两阶段训练范式让智能体内化准确前瞻推理的框架。首先,我们提出有依据的前瞻蒸馏(Grounded LookAhead Distillation,GLAD),让智能体在源自环境搜索的轨迹上进行监督微调。通过将复杂搜索树压缩为简洁的因果推理链,智能体学会前瞻的逻辑,而无需承担推理时搜索的计算开销。其次,为进一步提升决策精度,我们提出蒙特卡洛评论家(Monte-Carlo Critic,MC-Critic),一个即插即用的辅助价值估计器,旨在增强PPO和GRPO等策略梯度算法。通过利用轻量的环境滚动来校准价值估计,MC-Critic提供低方差信号,促进稳定的策略优化,而无需依赖昂贵的基于模型的价值近似。在随机(如2048)与确定性(如Sokoban)环境上的实验表明,ProAct显著提升规划准确性。值得注意的是,经ProAct训练的4B参数模型胜过所有开源基线,并与最先进的闭源模型相当,同时对未见环境表现出稳健泛化。代码与模型可在https://github.com/GreatX3/ProAct获取。
