论文
编写或自动化语言提示,这就是问题
To Write or to Automate Linguistic Prompts, That Is the Question
摘要
LLM 的性能对提示设计高度敏感,但自动提示优化是否可以取代语言任务中的专家提示工程仍有待探索。我们首次对手工制作的零样本专家提示、基本 DSPy 签名和 GEPA 优化的 DSPy 签名在翻译、术语插入和语言质量评估方面进行了系统比较,评估了五种模型配置。结果取决于任务。在术语插入中,优化和手动提示产生的质量在统计上几乎无法区分。在翻译中,每种方法都在不同的模型上获胜。在 LQA 中,专家提示可实现更强的错误检测,同时优化可改善表征。在所有任务中,GEPA 都提升了最小的 DSPy 特征,并且大多数专家优化的比较显示没有统计上的显着差异。我们注意到这种比较是不对称的:GEPA 优化以编程方式搜索金标准分割,而专家提示原则上不需要标记数据,而是依赖于领域专业知识和迭代细化。