论文
FSPO:预算化LLM RL后训练的策略一致风险与帕累托可行控制
FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
摘要
自适应LLM强化学习后训练在线改变多个训练执行器:rollout温度、组大小、裁剪、KL正则、验证器分配与更新预算。三个耦合问题未解:从行为轨迹训练的未来风险模型未必估计将被部署控制器诱导的风险;在记录的状态-动作对上校准的分数在选择性行动选择后可能失准;独立的单资源最小成本一般不能证明多资源延续可行。我们提出FSPO——面向预算化LLM RL后训练的反馈状态控制器,联合处理三者:FSPO学习策略一致的未来累计风险模型,其Bellman目标遵循用于未来决策的同一冻结控制器,并配备长程效用模型;决策条件轨迹校准(DCTC)在由临时控制器所选动作生成的交叉拟合轨迹上校准风险;帕累托资源延续证书(PRCC)只在非支配的累计预留对剩余地平线保持可行时才接纳动作。在匹配GRPO资源包络下,FSPO达66.11%留出与59.43% OOD准确率,对最强自适应基线PB2的64.47%与57.03%;三个配对训练种子在留出与OOD评估上较上下文老虎机提高+2.42与+3.19个百分点。高行为-部署错配下,策略一致风险把选定决策ECE从0.108降至0.053;DCTC在匹配接受率下把ECE从0.039降至0.022;PRCC在18动作目录上消除假可行接纳(0.197→0.000);析因消融中三组件全开使轨迹失败从0.181降至0.083。