论文

基于经验迭代蒸馏的黑盒LLM多步推理与工具使用提示策略

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

上下文与知识模型训练强化学习上下文工程Agentic RL

摘要

向与冻结的“黑盒”大语言模型(LLM)交互的转变,已使提示工程从启发式操作转变为关键的优化挑战。我们提出一个强化学习(RL)框架,通过经验迭代蒸馏来训练可学习的提示策略。在该架构中,一个轻量级提示器模型经过优化,以最大化更大规模冻结工作LLM的任务特定奖励。通过使用将标量奖励与密集文本批评相耦合的对比经验缓冲区,我们的方法有效地将迭代式提示精炼摊销为单次成型(single-shot)的策略权重。我们的实验分析聚焦于Big Bench Extra Hard(BBEH)与Tau-bench套件,覆盖多样的多步推理与工具使用任务。我们展示了显著增益:在逻辑密集型推理中将性能从55%提升到90%,在工具使用任务中从74%提升到91%。此外,我们分析了提示的结构演化,展示该策略如何发现专门的算法启发式。我们与GEPA等最先进的进化式基线进行了全面比较,表明迭代蒸馏以更高的样本效率取得更优性能。

基于经验迭代蒸馏的黑盒LLM多步推理与工具使用提示策略:论文配图
图 1:提示性政策框架。提示器策略 πθ\pi_{\theta} 生成一个以任务上下文 cc、采样经验历史 ℋ\mathcal{H} 为条件的提示 pp,指示冻结的任务模型 ℳ\mathcal{M} 为输入 xx 生成响应 yy。奖励是根据输入上下文 cc 条件下的一段采样数据的聚合奖励来计算的。