论文
DecisionLLM:面向长序列决策探索的大语言模型
DecisionLLM: Large Language Models for Long Sequence Decision Exploration
摘要
长序列决策通常通过强化学习(RL)解决,是在动态环境中优化战略运营的关键环节,例如计算广告中的实时竞价。Decision Transformer(DT)通过把 RL 构造为自回归序列建模问题,引入了一个强大的范式。与此同时,大语言模型(LLM)在复杂推理与规划任务上取得显著成功。这启发我们思考:与 DT 共享 Transformer 基础但规模大得多的 LLM,能否在长程序贯决策问题上解锁新的性能水平。本工作研究 LLM 在离线决策任务上的应用。该领域的一个根本挑战是 LLM 天生无法解读连续数值,因为当数值以文本字符串表示时,它们缺乏对数值大小与顺序的原生理解。为此,我们提出把轨迹视为一种独立模态。通过学习将轨迹数据与自然语言任务描述对齐,我们的模型可以在一个我们称为 DecisionLLM 的统一框架内自回归地预测未来决策。我们建立了支配该范式的一组缩放定律,表明性能取决于三个因素:模型规模、数据量与数据质量。在离线实验基准与竞价场景中,DecisionLLM 取得了强劲表现。具体而言,DecisionLLM-3B 在 Maze2D umaze-v1 上超过传统 Decision Transformer(DT)69.4,在 AuctionNet 上超过 0.085。它扩展了 AIGB 范式,并为在线竞价的未来探索指明了有前景的方向。
