论文

为大语言模型优化提示:一种因果方法

Optimizing Prompts for Large Language Models: A Causal Approach

上下文与知识上下文工程

摘要

大语言模型(LLMs)日益嵌入企业工作流,但其性能对提示设计仍然高度敏感。自动提示优化(Automatic Prompt Optimization,APO)旨在缓解这种不稳定性,但现有方法面临两个持续存在的挑战。第一,常用的提示策略依赖静态指令,平均表现良好,却无法适应异构的查询。第二,更动态的方法依赖离线奖励模型,而后者本质上是相关性的,会把提示效果与查询特征混同。我们提出因果提示优化(Causal Prompt Optimization,CPO),一个把提示设计重构为因果估计问题的框架。CPO分两个阶段运行。第一阶段,通过对提示与查询的语义嵌入应用双重机器学习(Double Machine Learning,DML)来学习一个离线因果奖励模型,把提示变体的因果效应与起混淆作用的查询属性隔离开。第二阶段,利用这一无偏奖励信号,在不依赖昂贵在线评估的情况下,指导资源高效的、按查询定制提示的搜索。我们在数学推理、可视化和数据分析基准上评估CPO。CPO持续优于人工设计的提示和最先进的自动优化器。收益主要来自对困难查询的稳健性提升,而现有方法在这些查询上往往会退化。除性能之外,CPO从根本上重塑了提示优化的经济学:通过把评估从实时模型执行转向离线因果模型,它能够以在线方法所需推理成本的一小部分实现高精度的按查询定制。这些结果共同确立了因果推断作为企业LLM部署中可靠且高性价比提示优化的可扩展基础。

为大语言模型优化提示:一种因果方法
图2:所提出的 Causal Prompt Optimization(CPO)框架概览