论文

面向检索智能体的自然语言查询到配置转换

Natural Language Query to Configuration for Retrieval Agents

上下文与知识检索增强

摘要

现代检索智能体暴露出许多配置选择——LLM、检索器、文档数量、跳数与综合策略——每一项都同时影响回答质量与服务成本。如今,这些流水线通常针对每个工作负载手工调优一次,大量逐查询优化空间未被开发。我们对该问题进行形式化:给定一个自然语言查询以及精度或预算目标,在推理时从预定义的流水线目录中选择使成本最小或精度最大的配置。我们提出**BRANE**:先用LLM将每个查询转换为工作负载特定特征,再训练一个轻量的逐配置预测器,估计该流水线能否正确回答该查询。在推理时,**BRANE**选择被成本惩罚后的预测正确率最大的配置,无需重训练即可提供可调节的成本-质量权衡。在MuSiQue、BrowseComp-Plus与FinanceBench上,**BRANE**持续推动成本-质量Pareto前沿,能以最高89%更低的成本达到最优固定配置的精度,并优于LLM路由、基于规则与微调Qwen3-4B等基线。这些结果表明,对完整检索流水线进行逐查询配置是静态工作负载级调优的实用替代方案。

面向检索智能体的自然语言查询到配置转换:论文配图
图 2:BRANE 框架。 BRANE 为每个查询选择管道配置,以最大限度地降低目标精度的成本。 (1) 配置分析:我们针对工作负载上的每个候选配置运行每个查询,记录正确性和美元成本。 (2) 预测器训练:前沿LLM从小查询样本中提出特定于工作负载的二进制特征(例如,需要多跳推理、涉及人);然后,一个更便宜的LLM会根据这些特征标记所有分析的查询。我们为每个帕累托配置训练一个轻量级预测器,以估计它在给定其特征的情况下正确回答查询的概率。帕累托配置比全套配置少一个数量级。 (3) 推理(可重新配置):给定准确度或预算目标,BRANE 对传入查询进行一次表征,对每个 Pareto 配置进行评分,并选择最能对预测准确度与成本进行权衡的配置。工程师可以随时重新定位,无需重新训练。选择规则见§4.2。