论文

通过纯探索 Bandits 进行高效的多目标提示优化

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

上下文与知识上下文工程

摘要

快速工程已成为激发 大语言模型 (LLM) 功能的核心。其核心在于提示选择——有效地识别最有效的提示。然而,大多数先前的调查都忽视了一个关键挑战:及时绩效本质上是多方面的,无法用单一指标来衡量。为了填补这一空白,我们研究了两种实际设置下的多目标提示选择问题:帕累托提示集恢复和最佳可行提示识别。将问题引入纯探索老虎机框架中,我们采用来自多目标老虎机的可证明有效的算法,并进一步引入一种新颖的设计,用于结构化老虎机中最佳可行的手臂识别,并对线性情况下的识别误差提供理论保证。跨多个 LLM 的广泛实验表明,基于老虎机的方法比基线产生了显着的改进,为多目标提示优化建立了原则性且有效的框架。