论文
PAC-CF:在 LLM 引导搜索中校准不可逆边界修剪
PAC-CF: Calibrating Irreversible Frontier Pruning in LLM-Guided Search
摘要
LLM 引导搜索探索多个候选轨迹,但测试时间成本很高。修剪低分前沿候选人可以控制这种成本,但它也会将潜在有偏见的评估者分数变成不可逆转的决策:系统排名错误可能会在重复评分下持续存在并删除有用的分支。我们提出近似正确保形过滤(PAC-CF)。其固定前沿分析将消除公式化为有限评估者偏差下的 $(\varepsilon,δ)$-PAC 问题;它的操作规则通过在没有 PAC-CF 的情况下运行原始控制器并使用搜索后验证器标签来衡量保留解决方案的候选者相对于前沿领导者的缺陷,单独校准保留任务的分数差距阈值。以具有非空保护暴露的可交换本机控制器任务为条件,保角校准提供有限样本覆盖,以便在本机轨迹上的每个受保护边界保留至少一个验证者定义的有效延续。在部署时,PAC-CF 仅删除与最高前沿分数的差距超过冻结阈值的候选者。我们跨三个域、五个控制器和四个从 B100 到 B500 的请求预算评估 PAC-CF。在跨域/控制器宏观平均值中,所有三个工作负载度量的点估计值在每个预算中都较低;效用的配对引导 95% 置信区间不包括 B100 和 B200 处的零。对于修剪感知的 ToolTree,在每个测试预算下,完整测试集的跨域效用差异为 $+4.38$ 点;在自然终止敏感性队列中,物理请求减少了 $18.94$--$18.95\%$,端到端词元使用量减少了 $23.57$--$23.76\%$。