论文

RECAST:学习在检索与计算之间选择证据获取路径

RECAST: Learning to Compute the Right Context through Adaptive Evidence Routing

模型训练上下文与知识智能体系统强化学习上下文工程Agent 工具调用Agentic RL

摘要

大语言模型越来越多地用于依赖长篇、异构信息源的任务。传统检索增强生成(RAG)采用固定的相似度检索,Agentic变体虽能调整查询和工具使用,仍主要围绕检索展开。然而,许多任务所需的证据并不直接存在于某一条来源中,而需要对多个来源进行筛选、聚合或计算后才能获得。我们提出RECAST(通过计算、访问与综合工具进行证据路由),将证据构建表述为异构检索和计算操作的顺序决策过程,使系统能够主动推导证据,而不只是取回证据。轻量RouterLM迭代选择并构造基本操作,也可指定自定义操作,由冻结的CompilerLM转为可执行代码。RouterLM判断证据充分后,将接受的证据交给冻结的AnswerLM生成最终答案。我们通过监督微调(SFT)和组相对策略优化(GRPO)训练RouterLM。在六组异构基准中,RECAST平均成功率为75.6%,较最强大模型基线高15.9%。经训练的Qwen3.5-9B RouterLM较未训练的Gemini 3.5 Flash RouterLM高5.0%。在三个留出基准上,RECAST较最强基线平均提高15.0%,展现出跨任务、跨异构来源表示的零样本泛化能力。

RECAST:学习在检索与计算之间选择证据获取路径:论文原图
图 1:RECAST 概述。在每一轮中,RouterLM 使用任务、紧凑源配置文件以及前轮的证据和反馈来选择和制定原始或综合操作,或者在认为证据足够时将证据传递给 AnswerLM。