论文
RECAST:学习在检索与计算之间选择证据获取路径
RECAST: Learning to Compute the Right Context through Adaptive Evidence Routing
摘要
大语言模型越来越多地用于依赖长篇、异构信息源的任务。传统检索增强生成(RAG)采用固定的相似度检索,Agentic变体虽能调整查询和工具使用,仍主要围绕检索展开。然而,许多任务所需的证据并不直接存在于某一条来源中,而需要对多个来源进行筛选、聚合或计算后才能获得。我们提出RECAST(通过计算、访问与综合工具进行证据路由),将证据构建表述为异构检索和计算操作的顺序决策过程,使系统能够主动推导证据,而不只是取回证据。轻量RouterLM迭代选择并构造基本操作,也可指定自定义操作,由冻结的CompilerLM转为可执行代码。RouterLM判断证据充分后,将接受的证据交给冻结的AnswerLM生成最终答案。我们通过监督微调(SFT)和组相对策略优化(GRPO)训练RouterLM。在六组异构基准中,RECAST平均成功率为75.6%,较最强大模型基线高15.9%。经训练的Qwen3.5-9B RouterLM较未训练的Gemini 3.5 Flash RouterLM高5.0%。在三个留出基准上,RECAST较最强基线平均提高15.0%,展现出跨任务、跨异构来源表示的零样本泛化能力。
