论文
ProCeedRL:面向LLM智能体推理的过程评论器与探索性示范强化学习
ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning
摘要
强化学习(RL)显著提升大语言模型(LLM)的推理能力,但受制于交互的长程性与环境反馈的随机性,将其应用于多轮智能体任务仍具挑战。我们识别出智能体探索中的一种结构性失效模式:次优动作会将含噪观察引入误导性上下文,进一步削弱后续决策,使恢复愈发困难。这种累积的误差反馈回路使标准探索策略失效,且易受模型推理与环境随机性的影响。为缓解该问题,我们提出ProCeedRL:过程评论器与探索性示范强化学习,将探索从被动选择转向主动干预。ProCeedRL采用过程级评论器实时监测交互,并引入基于反思的示范引导智能体停止误差累积。我们发现该方法显著超过模型饱和探索的性能,展现出可观的探索收益。通过从探索性示范与同策略样本中学习,ProCeedRL显著提升探索效率,并在复杂深度搜索与具身任务上取得卓越性能。