论文

超越置信度:基于检索接地的多轮搜索智能体测试时扩展

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

模型推理推理验证与自校正

摘要

基于置信度的投票通过token对数概率等内部信号为每个并行LLM rollout加权并聚合,已在单轮推理中得到积极研究。然而,现代LLM越来越多地充当多轮搜索智能体,需要检索外部文档并以其为条件。本文表明,基于置信度的投票难以迁移到这种多轮设置,并识别其失败根源为复制膨胀(copy inflation):当检索到的文档被附加到智能体上下文时,从文档复制的token会获得系统性膨胀的对数概率。这使同一问题内的置信度分数被拉平,削弱了加权投票的效果。为解决该问题,我们提出检索接地投票(Retrieval-Grounded Voting, RGV),以每个rollout的最终答案与其检索到的文档之间的词法重叠度为其打分。通过在被污染的上下文之外计算信号,RGV既绕开了token对数概率,也无需额外的LLM调用。在四个搜索智能体基准和五个LLM上,RGV持续优于基于置信度的投票,准确率提升最高达+5.4%,在8个rollout中仅有1-2个给出正确答案的少数正确问题上提升高达+35%。

超越置信度:基于检索接地的多轮搜索智能体测试时扩展:论文配图
图1:概览。(a) 每次rollout是ReAct式搜索智能体的一条轨迹,循环执行工具调用(搜索、访问页面)并给出预测答案;N次并行rollout可能各不相同。(b) 加权投票将每次rollout的权重按预测答案求和;argmax者胜出。(c) 基于置信度的投票以token对数概率为每次rollout加权,当模型鹦鹉学舌般复述上下文时权重会被抬高。RGV(我们的方法)以答案文本与检索文档间的词汇重叠为每次rollout加权——该信号在受污染的上下文之外读取。