论文

更多利用,更聪明探索:预算受限的Agentic搜索

Exploit More, Explore Smarter for Budget-Constrained Agentic Search

模型推理推理搜索与路径规划

摘要

当LLM智能体必须在很小的评估预算下精炼候选时,就产生了预算受限的Agentic搜索,原因可能是验证昂贵、生成需要多次模型调用,或两者兼有。在这种情形下,标准MCTS的预算分配很差:在低访问次数时探索奖励占主导,有希望的链还没来得及深化就已扩展无希望的兄弟节点,且分支与节点质量无关。我们提出ExTS,一种将扩展本身视为信息价值决策的树搜索策略。ExTS结合三种机制:判别式奖励塑形,用于在狭窄的分数分布下区分候选;随机虚拟子节点,根据父节点的奖励历史估计创建新分支的价值;以及质量条件化分支,仅当节点的分数足以证明预算成本合理时才扩展。在提示优化、代码生成、分子结构解析和Agentic工作流优化任务上,ExTS与任务特定的树搜索基线相当或更优,使用单一固定配置取得平均+5.5%的相对增益。我们进一步引入试点运行诊断,刻画是什么使预算受限的Agentic搜索问题在结构上彼此不同,从而既提供对问题空间的理解,也提供适配的实用指导。