论文

快速优化器应该如何度过紧张的预算?具有噪声自适应评估功能的 BudgetAPO

How Should a Prompt Optimizer Spend a Tight Budget? BudgetAPO with Noise-Adaptive Evaluation

模型推理推理策略与问题分解

摘要

自动提示优化(APO)已被广泛应用于调整大语言模型而不更新其权重,产生了有希望的结果。然而,现有的方法(例如 GEPA 和 OPRO)假设了数百到数千次主题模型调用,远远超出了付费、限速 API 背后的实际情况。在预算紧张的情况下,它们会以两种方式失败:多阶段管道可能会耗尽预算并不变地返回种子提示,而单阶段方法会在固定大小的小批量上比较候选者,而不管每个任务的噪音如何。作为补救措施,我们引入了 BudgetAPO,这是一个针对预算紧张的情况的单级优化器。 BudgetAPO 包含 (1) 噪声自适应规则,根据每个任务的噪声调整评估切片的大小,通过短探针进行测量; (2) 一个固定切片,将每个接受/拒绝决策转变为配对比较; (3)反射算子,共同重写推理策略和输出格式。七个基准和五个主题模型的广泛结果表明,BudgetAPO 在每个主题上都排名第一,并且在 Holm 校正配对测试下击败了每个基线,同时在 250 次调用中以 13% 的运行率返回种子,而 GEPA 为 86%。在 GPT-OSS-20B 上,GEPA 需要 4.5 倍的调用才能匹配 BudgetAPO 的 100 次调用分数。

快速优化器应该如何度过紧张的预算?具有噪声自适应评估功能的 BudgetAPO的原论文方法或结果图
图 2:一次 BudgetAPO 运行。校准花费了 16 次调用来读取 $\hat{\sigma}$,这修复了 $s$ 行的切片;每轮细化都会花费 $k\,s$ 调用(等式 5),并且只有在击败现有候选者时才保留候选者(等式 7)。