论文

训练语言模型与推理时控制器协作

Training Language Models to Cooperate with Inference-Time Controllers

模型训练强化学习RLVR

摘要

大语言模型(LLM)的性能日益不仅取决于基础模型,也取决于用于组织推理的推理时控制器。然而,现有后训练方法通常只针对单一固定的交互模式进行优化,尽管真实部署依赖多样的控制器,如思维链、自一致性、辩论、规划与验证流水线。这造成训练-部署失配,并限制向新工作流的迁移。我们提出CALM(Controller-Aware Language Models),一个把控制器显式纳入训练环的后训练框架。我们把控制器感知的后训练表述为在控制器诱导的交互协议上进行的多任务强化学习,其中控制器是可复用局部推理模块的组合。这一结构还在轮级GRPO目标下引出混合控制器训练的模块级分解,从而支持对控制器感知与模块感知训练策略的系统研究。我们在留出的控制器组合与更广的控制器偏移上评估CALM,表明控制器感知的后训练能提升跨推理时工作流的泛化,超越单控制器优化。

训练语言模型与推理时控制器协作:论文配图
图 2:单控制器训练的不同训练配置的训练曲线 (B1–B6)