论文

大语言模型 用于顺序决策:通过监督 微调 改进情境学习

Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning

模型训练监督微调与指令调优

摘要

大语言模型 (LLM) 表现出了卓越的上下文学习 (ICL) 能力,但其顺序决策的潜力尚未得到充分开发。在本文中,我们研究了 LLM 在顺序决策设置中的 ICL 功能,包括马尔可夫决策过程 (MDP)、部分可观察 MDP (POMDP) 和模糊 POMDP (APOMDP)。我们对预训练的 LLM 进行微调,以直接从离线的、预言机标记的轨迹执行几次决策。我们的框架可以通过受监督的 微调 (SFT) 灵活模仿策略。理论上,我们关注线性 MDP,并将微调的注意力层解释为根据上下文数据隐式估计最优 Q 函数。基于这种解释,我们得出了诱导策略的端到端次优界限,该策略将上下文估计误差与训练长度偏差分开。根据经验,在合成 MDP、POMDP 和 APOMDP 设置中,我们发现经过微调的 LLM 比仅上下文和随机基线实现了更小的最优性差距,在较长视野、部分观察和模型模糊的环境中收益尤其大。总之,这些结果表明,有监督的 微调 提供了一种有效的途径,赋予预训练的 LLM 离线数据的顺序决策能力,这在离线数据丰富的医疗保健等领域是一个重要优势。