论文

为什么提示优化有效,以及为什么有时无效:因果启发的编辑级分析

Why Prompt Optimization Works, and Why It Sometimes Doesn't: A Causal-Inspired Edit-Level Analysis

模型评测模型行为与机制分析

摘要

自动提示优化方法(例如 DSpy、TextGrad)可以显着提高 大语言模型(LLM)的性能,但是它们跨不同任务的泛化能力仍然不佳。在实践中,一个基准上优化提示的优越性通常无法转移到另一个基准上,即使在不同的 LLM 主干之间切换时,这种限制仍然存在。为了调查提示性能中未被充分探索的异质性来源,我们对一组不同的优化框架、LLM 主干和 NLP 基准对优化提示进行了因果推理启发的观察分析。为了实现这一目标,我们建立在倾向调整关联分析以及提示编辑的多种互补表示的基础上,其中识别出一致的任务条件编辑模式。我们发现复杂性增加和元指令编辑与数学和多跳推理性能呈负相关,而逐步和元认知编辑则改善逻辑和顺序推理任务。这些效应在认知负荷注释、表面水平文本特征和编辑主题分析中都很强大,并且可以跨优化框架推广。总体而言,这些结果表明,即时优化失败是由编辑族和任务特征之间的系统交互引起的,而不是随机优化工件,提供了优化器行为的特征级表征并激励未来的任务条件优化器设计。