论文

用于文档提取的有效每字段选择性风险控制:三种失败模式、有效性阶梯以及条件何时发挥作用

Valid Per-Field Selective Risk Control for Document Extraction: Three Failure Modes, a Validity Ladder, and When Conditioning Pays

模型推理推理验证与自校正

摘要

每个字段接受/审查的选择性风险最高为 alpha——只有在接受字段之间的错误率得到控制的情况下才接受字段——是信任合同文档提取系统所需要的,而自然程序在真实文档上默默地违反了它。在来自 800 个 CORD 收据的 13,859 个真正的 claude-sonnet-5 字段(正确率 49.0%)上,我们诊断了三种故障模式:文档聚类(设计效果 1.84-2.45)、分数修改泄漏(覆盖率 0.416,风险 0.127,在 95% 的分割中违反 alpha=0.10)和平局质量病理学(退化分数)折叠阈值网格,0.030 至 0.001)。我们将修复程序组织为有效性阶梯,每层规定保证形式。拟合/验证分离协议恢复了学习融合的预期选择性风险控制:在标称 alpha=0.10 时,覆盖范围为 0.318,风险为 0.096,无公差带(生产变体 0.326)——这是一个平均点,其实现的风险在 47.5% 的重新分割中超过 alpha,而不是证书。 Mondrian Learn-then-Test 使用精确的二项式尾部生成每组 PAC 证书:field-iid 0.171 atrisk 0.068、cluster- Corrected 0.140、doc-iid 0.060——唯一的层匹配文档,老实说今天几乎是空的。 Support-bin,预先指定的出处分类法,在十四行诗 CORD 捕获上赢得了每个严格等级(p<1e-4,Bonferroni 校正)——这种胜利不会在俳句或 qwen 下的相同文档上复制——而在更高精度的语料库池阈值上获胜:调节有助于准确地在池无法证明的地方,包含在其他地方的学习分数中。对选择未触及的 claude-haiku-4-5 在两个风险级别上进行的冻结配置确认,以及盲三注释者人类标准审计验证了实际层的接受集风险为 1.3%,相对于其 10% 的预算(Fleiss' kappa=0.83;标签错误地片面悲观)。发布了带有种子固定、回归门控程序的 Apache-2.0。