论文

适用于代理和多模式的情境感知强化学习 LLM

Context-Aware RL for Agentic and Multimodal LLMs

模型训练强化学习

摘要

当回答需要在长或复杂的上下文中识别小但决定性的证据时,例如工具轨迹中的单线或图像中的微妙细节,大语言模型 (LLM) 经常会失败。我们提出了 ContextRL,一种上下文感知强化学习(RL)方法,它通过 emph{间接} 辅助目标来提高长视野推理和多模态性能。 ContextRL 不是只监督最终答案,而是向模型提供一个查询、一个答案和两个高度相似的上下文,并奖励它选择支持查询-答案对的上下文,从而鼓励细粒度证据依赖。我们在两个领域构建对比上下文数据:对于 编码智能体,轨迹充当上下文,通过条件过滤生成 1k 对;对于多模态推理,图像充当上下文,通过生成编辑和相似性搜索生成 7K 对。 ContextRL 在 5 个长期基准测试中比标准 GRPO 平均增益 +2.2%,在 12 个不同的视觉问答基准测试中平均增益 +1.8%。为了将所提出的目标的效果与附加数据的效果分开,我们与数据增强基线进行比较,该基线将相同的对比上下文重新用作标准查询-上下文-答案示例。这些基线几乎没有提供任何改进,表明收益来自所提出的上下文选择目标,而不是仅来自对比数据。