论文

MetaResearcher:经对抗虚拟环境中的自反思强化学习扩展深度研究

MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments

模型训练强化学习RLVR

摘要

深度研究智能体在自主信息收集与综合上展现卓越能力——但其训练仍受仿真环境静态性、仅事实检索任务设计的局限与基于结果的强化学习低效制约。本工作中——我们提出MetaResearcher——跨四个协同维度扩展深度研究智能体训练的新框架。第一——我们引入演化虚拟世界——向训练环境注入时间动态与对抗性错误信息——迫使智能体发展来源可信度评估与时间冲突消解技能。第二——我们设计发现导向任务——包括假设生成与矛盾消解——超越简单事实检索——推动智能体走向真正的研究行为。第三——我们在GRPO框架内提出自反思元奖励机制——联合优化答案正确性、搜索路径效率、反思深度与工具调用多样性——直接解决先前工作观察到的重复动作回路问题。第四——我们引入异构多智能体集群架构——含专门的侦察者、过滤者与综合者模型——经协调强化学习学习协作研究策略。构建于LiteResearcher基础设施上——MetaResearcher训练零边际API成本——同时瞄准基准性能(GAIA、Xbench-DS)与对抗条件下认识鲁棒性的实质改进。我们呈现完整框架设计、训练方法学与计划的实验验证。