论文
当下更聪明:环境驱动的动态政策,持续改进大语言模型
Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement
摘要
大型语言模型(LLM)在不同领域取得了显着的进步,但不断适应不断变化的任务和环境仍然是一个关键挑战。现有的记忆增强方法检索单个过去的示例作为直接参考,但没有明确地从中合成可操作的策略,从而导致相同类型的错误再次发生。我们提出了基于动态检索的策略生成(DRPG),这是一个将基于内存的检索与动态策略生成器集成的框架,利用历史数据和环境反馈来生成特定于任务的策略,以实现大语言模型的持续改进。我们使用来自专有和开放权重系列的七名大语言模型,通过六个基准评估 DRPG,涵盖文本到 SQL、问答、医疗诊断和 Python 编程。 DRPG 在大多数数据集和模型中都优于强大的基线。进一步的分析表明,DRPG 的策略生成对于检索策略来说是稳健的,无需事先的策略连续性即可有效运行,并且可以利用较小或跨家庭的模型作为具有成本效益的策略生成器。我们还发现,政策层面指导的好处取决于任务特征,提供了关于何时以及在什么条件下该机制最有效的实用见解。