论文

OLLM:基于选项的大语言模型

OLLM: Options-based Large Language Models

模型架构新型架构

摘要

我们提出选项大语言模型(Options LLM,OLLM),这一简单而通用的方法用由离散潜变量索引的、针对下一token的“习得选项集合”(set of learned options)取代标准LLM的单一下一token预测。OLLM不再依赖温度或采样启发式来诱发多样性,而是显式地对变异性建模:一个小型潜空间参数化多个合理的下一token选项,可由下游策略选择或搜索。在架构上,OLLM是一个轻量的“插件”,在输出头之前插入编码器与解码器两层,几乎任何预训练LLM都能以极少的额外参数完成转换。我们将OLLM应用于在OpenMathReasoning上训练、在OmniMath上评测的1.7B参数骨干(仅$1.56\%$的参数可训练)。SOTA的LoRA适配基线最终答案正确率最高为$51\%$,而OLLM的选项集在最优潜变量选择下最高可达$\sim 70\%$。随后我们在潜空间中训练一个紧凑策略,输出潜变量以控制生成。在低维选项空间中运行使奖励优化的样本效率大幅提升,并显著减少常见的失调现象(如语言切换或退化推理),因为策略被约束在SFT阶段习得的选项之内。关键在于,这种对齐源自模型结构本身,而非额外的KL或手工设计的对齐损失。我们的结果表明,选项化的下一token建模提升了数学推理的可控性、鲁棒性与效率,并凸显潜空间策略学习是LLM强化学习的一个有前景方向。