论文

强化学习基础模型应该已经成为现实

Reinforcement Learning Foundation Models Should Already Be A Thing

模型训练合成数据

摘要

语言和视觉的基础模型由互联网规模的数据提供支持,而表格预测等结构化领域则由合成数据提供支持。这种替代品将挑战从收集转移到了先前的设计上。对于许多结构化任务来说,此类先验已经存在:TabPFN 及其后继者使用在合成贝叶斯先验上预训练的 Transformer 来解决表格分类问题。我们提出两点。首先,强化学习是一个明显的差距:对合成 MDP 进行采样与对合成表格数据集进行采样一样可行,但没有上下文中的 RL 工作将先前的设计视为主要目标。第二,MDP 承认固定大小的足够统计量,独立于观察到的事件和表格形状,这使得它们直接适合用于表格基础模型的基于注意力的架构,并用策略头取代监督目标。这些共同定义了强化学习基础模型的议程。作为概念证明,我们完全在合成 MDP 上训练图注意力网络,并表明,在没有针对特定任务的调整的情况下,它可以在线和离线解决上下文中的表格基准:在线,比 UCB-VI 和表格 Q-learning 少得多,离线,与 VI-LCB 竞争。