论文

DeFAb:基础模型可废止溯因的可验证基准

DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

模型评测模型训练强化学习基准与评测资源RLVR

摘要

基于规则的逻辑求解器以100%准确率在50微秒内解决我们基准的每个实例;最佳前沿语言模型最好达65%——在渲染鲁棒评估下降至23.5%(四种表面渲染的最坏值)。我们介绍DeFAb(可废止溯因基准)——把四十年公共资助知识库转为可废止溯因形式化锚定实例的数据集与生成管线:构造通过推翻默认值解释异常、同时保持无关期望的假设。因为每个假设必须通过有效推导、保守性与最小性的多项式时间检查——DeFAb使逻辑严谨成为度量创造力与理论推理的工具——为有纪律的理论修正构造打分——而非流畅但破坏理论的散文。该管线把分类层级(OpenCyc、YAGO、Wikidata)与行为属性图(ConceptNet、UMLS)配对——从18个来源、33.75M条物化规则产出372,648+实例——分三级、带多项式时间可验证金标准。四个前沿模型不能可靠内化可废止推理:渲染鲁棒的Level 2准确率为7.8-23.5%;思维链方差(约36pp)超过任何模型间差距;匹配的污染控制分离出+19.4pp的Level 3差距。我们进一步发布DeFAb-Hard(235实例Level 3难度变体;最佳模型53.3%对符号100%)与CONJURE(560个Lean 4/Mathlib实例的内核验证变革性创造力变体——其金答案是证明内核此前没有的定义;无裁判验证器;试点发现零个新概念)。同一验证器兼作偏好优化(DPO、RLVR/GRPO)的精确奖励。MIT许可发布于 https://huggingface.co/datasets/PatrickAllenCooper/DeFAb。

DeFAb:基础模型可废止溯因的可验证基准:论文配图
图 4:(a) 每个模型的渲染稳健精度(M1–M4 的最坏情况)。红色条处于或低于 16.7% 随机机会基线(虚线);所有四个模型均远低于 ASP 象征性上限(100%,上方虚线)。四个前沿模型中的两个无法在标题指标上击败随机机会。 (b) 渲染模态 M1-M4 加上渲染鲁棒列的准确性。所有模型在形式模态 (M2-M4) 上得分为 73-94%,但在叙事 M1 上得分下降至 14-22%,这证实形式模态性能反映的是表面语法模式匹配而不是推理。 (c) 第 3 级的评分分布:克劳德 (72%) 和基米 (84%) 的分数以“0 分”(异常完全未解决)为主,显示任务完全失败,而不是差点错过。附录 I 显示了所有八个(模型、水平)单元格中 CoT 效应的每单元格方差。