论文

更聪明地选择而非更多选择:具有次模保证的提示感知评估调度

Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees

上下文与知识上下文工程

摘要

自动提示优化(APO)取决于其评估信号的质量,但在完整训练集上为每个提示候选打分的代价高得令人望而却步。现有方法要么在优化开始前固定单一评估子集(有原则但与具体提示无关),要么在优化过程中启发式地调整(灵活但不稳定且缺乏形式化保证)。我们观察到APO可自然映射为在线自适应测试问题:提示是考生,训练样本是试题,调度器应选择最能区分最强候选的试题。这一洞见催生了提示感知在线评估调度(POES),它将基于IRT的区分度效用、设施选址覆盖项与考虑切换成本的热启动交换整合为一个可证明单调次模的统一目标,为冷启动提供(1-1/e)的贪心保证,为热启动更新提供有界漂移。自适应控制器根据优化进度调节探索与利用的平衡。在横跨三个基准家族的36个任务上,POES在相同评估预算下取得最高的总体平均准确率(较最佳基线提升6.2%),而token开销可忽略(约4%)。此外,在k=20个样本处的有原则选择即可匹敌乃至超过k=30-50时朴素评估的性能,将token消耗减少35-60%,表明更聪明地选择比选择更多更有效。我们的结果表明,评估调度是APO的一等组件,而非实现细节。

更聪明地选择而非更多选择:具有次模保证的提示感知评估调度:论文配图
图 2:POES 框架概述。调度器(虚线框)集成了五个组件:(1)噪声早期轮次的自动预热,(2)基于IRT的区分实用程序,(3)设施位置覆盖范围,(4)复合目标GtG_{t}的热启动交换优化,以及(5)调整(τt,Bt,λt)(\ tau_ {t},B_ {t},\ lambda_ {t})的自适应控制器。选定的子集 StS_{t} 反馈到评估模块,从而关闭优化循环。