论文
AIPO:从主动互动中学习推理
AIPO: Learning to Reason from Active Interaction
摘要
LLM 的最新进展展示了强大的推理能力,这很大程度上是受到 RLVR 的刺激。然而,对现有 RLVR 算法的探索在很大程度上仍然受到策略模型已有的知识和推理策略的限制。尽管最近的方法引入了外部专家演示来扩大探索,但它们通常依赖于完整的轨迹级指导,这可能是样本效率低下、信息稀疏且不足以适应中间推理瓶颈。受协作多智能体系统的启发,我们提出了 AIPO,这是一种增强的强化学习框架,可通过探索期间的主动多智能体交互来改进 LLM 推理。具体来说,当遇到推理瓶颈时,AIPO使策略模型能够主动咨询三个功能协作代理,即验证代理、知识代理和推理代理,从而在部署过程中获得细粒度和状态依赖的指导。由此产生的混合策略轨迹将策略暴露给可能难以通过孤立的 同策略 探索发现的推理方向。为了有效地从合作者提供的词元中学习,我们进一步引入了修正的重要性采样系数以及下限裁剪策略,以减轻 离策略 差异和消失梯度。训练后,策略模型独立推理,不依赖协作代理。数学、科学、编码和谜题推理基准的广泛实验表明,AIPO 持续提高推理性能,并在不同的策略模型、协作主干和 RLVR 算法之间进行泛化。