论文

通过语言模型函数调用进行反思性提示调整

Reflective Prompt Tuning through Language Model Function-Calling

上下文与知识上下文工程

摘要

大语言模型 (LLM) 遵循指令和复杂推理的能力越来越强,从而提供了一个灵活的界面来适应模型而无需更新参数。然而,提示设计仍然是劳动密集型的,并且对格式、措辞和指令顺序高度敏感,这激发了自动提示优化方法,减少手动工作,同时保持推理时间的灵活性。然而,现有的方法经常搜索提示候选者或使用由单个示例或小批量驱动的固定批评-细化管道,限制了它们捕获系​​统错误模式并根据故障历史进行有针对性的编辑的能力。我们提出了反射提示调优(RPT),这是一个使用 LLM 函数调用来模拟人类提示工程师的迭代工作流程的框架。 LLM 优化器调用诊断函数,该函数在整个优化集上评估目标模型,总结重复出现的故障模式,并返回结构化诊断报告。优化器使用此报告以及先前报告的累积内存来修改下一次迭代的提示。 RPT 通过在诊断反馈和最终提示选择中使用校准信号,进一步支持置信感知优化。在三项推理任务中,RPT 比初始提示提高了 12.9 分,与最先进的技术保持竞争力,并提高了置信度校准。我们的分析表明,RPT 在多跳和数学推理方面特别有效,可以产生与诊断出的故障模式相一致的有针对性的即时修订,并导致任务性能和校准方面的收益。