论文

统计上不可区分,操作上不同:表格基础模型的形式障碍

Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models

模型评测模型能力评测

摘要

如果无法访问管理系统的规则,表格基础模型就无法对运行系统生成的数据进行推理。我们使该声明可证伪。 \emph{操作图灵测试} (OTT) 构造合法和违反规则的数据库状态对,其 $1$- 和 $2$-way 列值边际与 $<0.02$ 的总变化相匹配;然后,Le~Cam 的引理将任何仅值分类器限制在 $\geq0.49$ 贝叶斯误差处。三个仅值基线(XGBoost、TabICL、TabPFN)完全达到了界限(准确度 $0.50$,预先注册的两个单边测试 (TOST) $p<0.002$),原始行级访问没有帮助,暴露关系值一致性弥补了大部分差距,只有由七个可执行规则派生审计提供的分类器达到 $1.00$ 分类准确度。在三个匹配的 $100$ 状态前沿大语言模型 (LLM) 运行中,给定架构、触发器源、规则表和状态文件的模型将最多 $2/50$ 合法状态分类为 LEGAL;即使有更高的推理工作和结构化查询语言 (SQL) 执行器,GPT-5.5 也接受 $0/50$ 法律状态。访问阶梯模式还出现在具有结构不同的规则系列的第二个模式上(银行分类账:跨行余额、累积聚合)。障碍是可识别性,而不是容量:如果没有运营基础,规模、数据和更丰富的功能就无法跨越它。