论文

LLM搜索智能体的推理时预算控制

Inference-Time Budget Control for LLM Search Agents

智能体系统Agent 规划

摘要

LLM 搜索代理在推理时越来越依赖工具,但它们的轨迹通常受到工具调用和生成词元的硬限制的限制。在这种双重预算下,更好的答案不仅需要更强大的模型,还需要明确控制哪个搜索动作应该接收下一个预算单位,以及何时积累的证据足以提交最终答案。我们在多跳问答(QA)中研究这个问题,并将其表述为两阶段推理时间预算控制。在搜索时,我们的控制器为每个可行的操作分配一个任务级信息价值(VOI)分数,定义为当前搜索状态和剩余双重预算下每单位预算边际任务价值的操作估计,并使用该分数在检索、分解和答案承诺之间进行选择。搜索后,选择性的基于证据的终结器将轨迹答案与精炼的候选答案进行比较,并且仅当残余错误似乎是低风险答案形式错误时才重写。在四个多跳 QA 基准、三个 LLM 主干和四个预算水平上,该方法在相同的硬双预算协议下比四个审计基线产生了正的总收益。消融表明,搜索时间预算控制,尤其是与预算相关的惩罚,提供了主要的性能增益,而回答时间控制主要在检索路径已经足够的情况下提供帮助。这些结果表明,LLM 搜索代理的推理时间预算控制应该控制搜索过程中预算的支出方式以及最终答案的提交方式。

LLM搜索智能体的推理时预算控制:论文配图
图 1:问题草图。智能体从观察到的轨迹、证据和剩余预算中选择下一步的搜索行动;未来的证据和确切的下一个成本尚不清楚。