论文
超越置信度:基于检索接地的多轮搜索智能体测试时扩展
Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding
摘要
基于置信度的投票通过token对数概率等内部信号为每个并行LLM rollout加权并聚合,已在单轮推理中得到积极研究。然而,现代LLM越来越多地充当多轮搜索智能体,需要检索外部文档并以其为条件。本文表明,基于置信度的投票难以迁移到这种多轮设置,并识别其失败根源为复制膨胀(copy inflation):当检索到的文档被附加到智能体上下文时,从文档复制的token会获得系统性膨胀的对数概率。这使同一问题内的置信度分数被拉平,削弱了加权投票的效果。为解决该问题,我们提出检索接地投票(Retrieval-Grounded Voting, RGV),以每个rollout的最终答案与其检索到的文档之间的词法重叠度为其打分。通过在被污染的上下文之外计算信号,RGV既绕开了token对数概率,也无需额外的LLM调用。在四个搜索智能体基准和五个LLM上,RGV持续优于基于置信度的投票,准确率提升最高达+5.4%,在8个rollout中仅有1-2个给出正确答案的少数正确问题上提升高达+35%。
