论文
快速优化器应该如何度过紧张的预算?具有噪声自适应评估功能的 BudgetAPO
How Should a Prompt Optimizer Spend a Tight Budget? BudgetAPO with Noise-Adaptive Evaluation
摘要
自动提示优化(APO)已被广泛应用于调整大语言模型而不更新其权重,产生了有希望的结果。然而,现有的方法(例如 GEPA 和 OPRO)假设了数百到数千次主题模型调用,远远超出了付费、限速 API 背后的实际情况。在预算紧张的情况下,它们会以两种方式失败:多阶段管道可能会耗尽预算并不变地返回种子提示,而单阶段方法会在固定大小的小批量上比较候选者,而不管每个任务的噪音如何。作为补救措施,我们引入了 BudgetAPO,这是一个针对预算紧张的情况的单级优化器。 BudgetAPO 包含 (1) 噪声自适应规则,根据每个任务的噪声调整评估切片的大小,通过短探针进行测量; (2) 一个固定切片,将每个接受/拒绝决策转变为配对比较; (3)反射算子,共同重写推理策略和输出格式。七个基准和五个主题模型的广泛结果表明,BudgetAPO 在每个主题上都排名第一,并且在 Holm 校正配对测试下击败了每个基线,同时在 250 次调用中以 13% 的运行率返回种子,而 GEPA 为 86%。在 GPT-OSS-20B 上,GEPA 需要 4.5 倍的调用才能匹配 BudgetAPO 的 100 次调用分数。
