论文

LoongReflect:通过全局视角增强搜索代理的长视野反射 蒸馏

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

模型训练强化学习

摘要

大语言模型 智能体越来越依赖长期推理来解决涉及规划、工具使用和内存的复杂任务。这种情况下的一个关键能力是反思:评估轨迹进展,识别缺失的证据和不可靠的中间状态,并决定是否继续、修改或放弃当前分支。然而,学习有效的反射具有挑战性,因为反射是在当前分支内本地执行的,而其效用只能由其对最终轨迹结果的贡献来确定。这种局部与全局的不匹配使得基于结果的强化学习只能为反思性决策提供局部、稀疏和延迟的监督。为了解决这些问题,我们提出了 LoongReflect,这是一个将反射制定为内存控制策略的训练框架。该代理使用显式反射和回溯动作在可逆轨迹树上运行。反思将经过验证的事实、缺失的证据和特定于分支的风险整合到工作记忆中,而回溯则从活动上下文中删除不可靠的分支并保留简洁的纠正教训。为了学习这一策略,LoongReflect 通过前瞻、超梯度式协调机制结合了两个互补信号。快速通道从享有特权的老师那里提炼出全球知情的反思行为,监督仅限于反思和回溯标记。慢速通道使用基于结果的 GRPO 优化完整轨迹,使本地控制决策与最终任务成功保持一致。多跳检索增强生成和数学推理基准的实验表明,与仅结果强化学习和自我 蒸馏 基准相比,有一致的改进。