保形选择性行动:针对经过 RLVR 训练的 LLM 进行随时有效的风险控制
Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs
摘要
本地专家 LLM 通过运营商本地数据的可验证奖励 (RLVR) 的强化学习进行微调,安装在受监管的组织中,每次部署错误预算为 $α$。操作员在每一轮都需要此部署流的安全证书:无需跨部署进行池化,无需等待长期平均值。现有的包装器无法在自适应、在线更新的流上提供此功能:离线共形风险方法需要可交换性;在线保形方法仅约束长期平均值;不可交换的扩展是有限有效的;最接近的随时包装器 A-RCPS 控制边际风险,而不是选择性风险。使用(测试统计、有效性保证、部署规则)框架,我们确定了由部署要求强制的一个空单元:每个阈值的电子流程、选择性风险、任何时间路径有效性、最大认证阈值规则。保形选择性作用 (CSA) 将其填充为每轮包装器,在 Bonferroni 网格上维持每个阈值的 Ville 型电子过程,并根据 RLVR 过滤进行评估。在可预测的更新和等渗校准的单调风险下,我们证明(i)任何时间路径选择性风险界限$R_T^{\mathrm{act}}\leα+O(N_T^{-1/2})$,(ii)速率最优认证匹配$θ(\barη^{-2}\log(1/δ))$,以及(iii)与水平无关的释放速率差距。在 8 个专业基准测试(480 美元流)、16 个对抗性分布转移单元(160 美元流)和 5 个实时专家迭代 RLVR 单元中,在三个架构系列中的四个基本模型上使用在线 LoRA(10{,}300 美元轮次),CSA 是 10 种比较方法中唯一满足路径有效性和每个单元上不可拒绝部署的方法。我们不提出新的 LLM、训练算法或策略类; CSA 是部署端的补充,与模型正交,适用于无法使用前沿 API 的运营商。