论文

Canopy:利用分段平滑树先验实现多保真强盗

Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits

模型推理推理搜索与路径规划

摘要

许多 LLM 推理问题,包括模型路由、前缀缓存管理、提示修剪和测试时搜索,都可以视为对树的优化。这种结构自然地由自回归生成产生:每个前缀定义一个节点,它的延续形成它下面的一个子树。树的内部节点提供了对区域值的廉价但有偏差的估计,而叶子评估虽然昂贵但准确。分层老虎机方法可以利用这种结构,但通常需要提前指定特定的平滑度计划,即使实际目标通常只是分段平滑,并且它们的最佳值可能位于尖锐边界附近。我们引入 CANOPY,一种多保真度树强盗,它学习平滑先验在哪里有效,而不是全局假设它。 CANOPY 使用廉价的随机路径探针来构建本地聚合偏差的在线证书,然后将昂贵的叶子评估指向证书检测到平滑度违规的单元。我们证明了固定预算和遗憾保证,其额外成本会增加不连续性的数量,在不存在违规时恢复平滑树率,并在违规变得密集时接近结构盲搜索。在路由、top-$k$ 识别、测试时搜索、缓存和提示修剪方面,CANOPY 持续改进了匹配预算性能,包括在 1000 个模型池中将前 10 名召回率提高了 2.9 美元,解决的 SWE 基准验证问题比 best-of-N$ 多了 1.6 倍,并且使用前缀缓存将第一个词元的中值时间降低了 3.6 倍。