论文

POETS:通过计算高效的策略集成实现不确定性感知 LLM 优化

POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles

模型训练强化学习

摘要

平衡探索和利用是顺序决策和黑盒优化的核心挑战。我们引入 POETS ($\textbf{Po}$licy $\textbf{E}$nsembles for $\textbf{T}$hompson $\textbf{S}$ampling),这是一种连接不确定性量化和策略优化的新颖框架。我们的方法基于这样的见解:使用 Kullback-Leibler (KL) 正则化训练的策略隐式编码了潜在的奖励函数。在此基础上,POETS 绕过了训练不确定性感知奖励模型并单独为该模型拟合策略的复杂、嵌套的过程。相反,我们直接训练一个策略集合,通过将隐式编码的奖励函数与在线引导数据相匹配来捕获认知不确定性。为了克服集成 大语言模型 (LLM) 的计算和内存限制,POETS 采用了高效的架构:集成共享预训练的主干,同时通过独立的低秩适应 (LoRA) 分支保持多样性。理论上,我们证明 POETS 隐式地进行 KL 正则化 Thompson 采样,从而继承了 ${\mathcal O}(\sqrt{T γ_T})$ 的强累积遗憾界限。根据经验,我们证明 POETS 在不同的科学发现领域(包括蛋白质搜索和量子电路设计)实现了最先进的样本效率。此外,它还改进了强化学习的优化轨迹,在具有经验回放或小数据集状态的 离策略 设置中证明特别稳健。