论文
面向检索智能体的自然语言查询到配置转换
Natural Language Query to Configuration for Retrieval Agents
摘要
现代检索智能体暴露出许多配置选择——LLM、检索器、文档数量、跳数与综合策略——每一项都同时影响回答质量与服务成本。如今,这些流水线通常针对每个工作负载手工调优一次,大量逐查询优化空间未被开发。我们对该问题进行形式化:给定一个自然语言查询以及精度或预算目标,在推理时从预定义的流水线目录中选择使成本最小或精度最大的配置。我们提出**BRANE**:先用LLM将每个查询转换为工作负载特定特征,再训练一个轻量的逐配置预测器,估计该流水线能否正确回答该查询。在推理时,**BRANE**选择被成本惩罚后的预测正确率最大的配置,无需重训练即可提供可调节的成本-质量权衡。在MuSiQue、BrowseComp-Plus与FinanceBench上,**BRANE**持续推动成本-质量Pareto前沿,能以最高89%更低的成本达到最优固定配置的精度,并优于LLM路由、基于规则与微调Qwen3-4B等基线。这些结果表明,对完整检索流水线进行逐查询配置是静态工作负载级调优的实用替代方案。
