论文

TAPR:用任务感知的提示重写器提升LLM表现

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

模型训练强化学习

摘要

大语言模型(LLMs)通常需要精心设计的提示来解锁其全部潜力,这往往成为非专家用户使用的主要障碍。本工作旨在解决这一挑战,引入一种任务导向的提示重写模型(TAPR),该模型通过将用户提示重新构建成任务优化提示,以明确目标,从而提升下游LLM性能。我们使用强化学习与组相对策略优化(GRPO)进行训练,其中奖励来自LLM作为裁判对重写提示和相应任务输出的评估。在各种任务上,如问答、摘要生成和算术推理,我们的方法在提示重写能力上取得了显著的改进。使用Phi-4-mini-instruct作为TAPR的基础模型进行微调,生成的提示包含更清晰和更具指导性的语言,从而在自然问题和GSM8K等基准上表现出更高的准确率。我们的代码可在:https://github.com/OliverSavolainen/task-specific-prompt-rewriter处获取。

TAPR:用任务感知的提示重写器提升LLM表现:论文配图
图2:NQ 数据集上 TAPR 的训练奖励对比。上图展示本文方法的逐步原始奖励(蓝色)及其25步移动平均或运行均值(橙色);下图展示不使用提示质量奖励的训练情况。