论文

Long-MDR:用于多模态深度研究的长上下文强化学习智能体

Long-MDR: Long-Context Reinforcement Learning for Multimodal Deep-Research Agents

模型训练强化学习

摘要

下一代多模态研究智能体必须对长期研究历史而不是短期模型完成进行推理。在单个任务中,智能体可能会重复搜索网络、检查视觉证据、重新审视早期假设,并积累数以万计的多模态上下文token。尽管存在这种趋势,用于多模态研究智能体的在线强化学习仍然主要局限于较短的上下文和交互范围。我们将在线 RL 训练推向 128k 上下文和 75 多个工具交互回合。据我们所知,这是第一个在 128k 环境下训练的在线多模态深度研究 RL 研究,也是第一个在 75 个工具轮换范围内训练的研究。扩展到这种机制暴露了传统 RL 训练的几个实际限制。在训练早期,弱策略未能很好地利用大量的交互预算,导致昂贵的执行轨迹几乎没有奖励改善。随后,策略熵可能会在性能饱和之前崩溃,从而提前结束有用的学习。我们推出 Long-MDR,这是一种专门为此设置而设计的三组分训练配方:在策略蒸馏预热、渐进地平线扩展和熵触发救援。这些技术共同提高了长视野强化学习的学习效率和稳定性,从而在直接训练缓慢且昂贵的情况下实现持续收益。在 50 轮评估预算中,我们经过 RL 训练的 Long-MDR-9B 在对比的 7B-9B 智能体的六个基准中的五个中排名第一。