论文
基于经验迭代蒸馏的黑盒LLM多步推理与工具使用提示策略
Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience
摘要
向与冻结的“黑盒”大语言模型(LLM)交互的转变,已使提示工程从启发式操作转变为关键的优化挑战。我们提出一个强化学习(RL)框架,通过经验迭代蒸馏来训练可学习的提示策略。在该架构中,一个轻量级提示器模型经过优化,以最大化更大规模冻结工作LLM的任务特定奖励。通过使用将标量奖励与密集文本批评相耦合的对比经验缓冲区,我们的方法有效地将迭代式提示精炼摊销为单次成型(single-shot)的策略权重。我们的实验分析聚焦于Big Bench Extra Hard(BBEH)与Tau-bench套件,覆盖多样的多步推理与工具使用任务。我们展示了显著增益:在逻辑密集型推理中将性能从55%提升到90%,在工具使用任务中从74%提升到91%。此外,我们分析了提示的结构演化,展示该策略如何发现专门的算法启发式。我们与GEPA等最先进的进化式基线进行了全面比较,表明迭代蒸馏以更高的样本效率取得更优性能。
