保形风险控制何时可以认证 LLM 输出?结构化生成的界限、不可能性和适应
When Can Conformal Risk Control Certify LLM Outputs? Bounds, Impossibility, and Adaptation for Structured Generation
摘要
为结构化生成(NER、JSON 提取、QA 和分类)部署的 大语言模型 (LLM) 缺乏正式的可靠性保证,并且标准启发式弃权策略在 7.5--12.5% 的设置上违反了用户指定的风险目标,并且没有每次部署保证。我们描述了保形风险控制 (CRC) 何时可以证明结构化 LLM 输出以及何时不能证明。首先,我们证明了一个锐化的、已达到的可行性边界:当基本风险 μ 超过目标 α 时,任何无分布方法都必须放弃至少 (μ-α)/(M-α) 的输入,从而产生一个封闭形式的可行性测试,在运行之前决定 CRC 是否可以工作。其次,我们建立了一个跨 Hoeffding、经验 Bernstein 和基于投注的 e-CRC 界限的经过验证的认证阶段图,验证了 716 种配置(六个开放权重模型 3B--72B、八个数据集、六个分数):在严格目标 (α<= 0.20) 下,认证集是嵌套的(51/72/80 已认证;Hoeffding-to-Bernstein 最大升级,+41%;e-CRC 校准效果最佳稀缺性),而在宽松的目标下,Hoeffding-Bernstein 指令在封闭形式边界处反转。第三,我们展示了负偏移结果和建设性的对应结果:在跨数据集偏移下,静态 CRC 和每个测试的自适应共形推理 (ACI) 步长在 16 次传输中的 14 次中违反了目标,但全反馈随时有效的监视器证明了 16 次传输中的 0 次,同时保持非空值。将目标放宽至 α= 0.40 可解锁实用认证(28% NER、13% QA、19% CLS)。该框架给出了一个三步部署方案:检查可行性,选择边界和评分,然后在班次下重新检查。