论文

工具自适应 LLM 重新排序器

Tool-Adaptive LLM Reranker

智能体系统Agent 工具调用

摘要

生成式 大语言模型 (LLM) 彻底改变了信息检索,但其严格的参数化性质在面对超出其认知边界的复杂查询时经常导致严重的事实幻觉。虽然外部工具调用可以缓解这种情况,但在重新排名期间不加区别地为每个文档调用搜索工具会产生令人望而却步的延迟开销,从而造成棘手的准确性-效率困境。为了应对这一挑战,我们提出了 TALRanker,这是一种新颖的框架,它将逐点相关性评分形式化为代理马尔可夫决策过程。我们通过两阶段训练范例对其进行优化。最初的热身利用保留语言的混合损失来防止对本地生成能力的灾难性遗忘。随后,强化学习中配备的不对称成本感知奖励迫使策略在有信心时自动绕过工具以实现最大效率,同时在不确定时选择性地检索外部证据以避免严重的幻觉惩罚。广泛的评估表明,TALRanker 在标准和推理密集型检索基准中实现了最先进的性能,将吞吐量与逐点重新排序器相匹配,同时优于参数密集型推理模型。