论文
自我改进的情境学习
Self-Improving In-Context Learning
摘要
我们建议通过优化测试时固定的几次提示的连续嵌入来改进上下文学习(ICL)。关键的观察结果是,模型分配给其演示输出$\unicode{x2013}$的对数概率可通过单个前向传递获得,而无需生成任何标记$\unicode{x2013}$,这为模型从演示中推断任务的效果提供了有意义的信号。我们将该信号形式化为有界的、自我监督的置信代理,并通过提示嵌入的零阶优化将其最大化,从而产生测试时间校准程序。该方法不需要微调,不需要生成标记,不需要预定义的标签集,也不需要外部数据,使其同样适用于分类和自由形式生成任务。在一套全面的 ICL 任务中,所提出的校准始终匹配或改进了基本模型,并且在大多数任务上优于特定于分类的基线。代理改进和下游准确性增益之间的统计显着相关性证实了所提出的代理为上下文学习编码了可靠的优化信号。