论文

TextReg:通过正则化文本空间优化缓解提示分布过度拟合

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

上下文与知识上下文工程

摘要

大语言模型 (LLM) 对用于指定任务目标和行为约束的提示高度敏感。许多最近的提示优化方法使用 LLM 生成的反馈迭代地重写提示,但生成的提示通常会变得更长,积累狭窄的特定于样本的规则,并且在训练分布之外泛化很差。我们将这种失败模式研究为提示分布过度拟合,并认为它反映了离散文本空间优化中缺乏表示控制。我们通过代表性低效率来形式化这一观点,这是一种双因素衡量标准,将即时低效率分解为容量成本和范围狭窄,将分布即时过度拟合归因于优化过程中的耦合增长。我们提出了 TextReg,一个正则化框架,它通过正则化文本梯度实现软惩罚目标,结合双证据梯度纯化、语义编辑正则化和正则化引导提示更新。在多个推理基准测试中,TextReg 显着提高了分布外 (OOD) 泛化能力,其准确度比 TextGrad 提高了 11.8%,比 REVOLVE 提高了 16.5%。