自信却出错:前沿LLM规则评估中的异常链坍缩
Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
摘要
我们记录了前沿大语言模型中的一类失败——异常链坍缩(exception chain collapse),它出现在形如“A是必需的,除非B适用,除非C覆盖B”的嵌套条件规则的资格评估中。该失败在首次观察时即可复现,但其经验表现并不稳定:2026年3月至4月间,同一模型别名下的若干失败单元格悄然关闭,版本号没有任何提升(GPT-5.4在建筑保险任务上从96.6%升至100%,提示词与评测框架完全相同)。对于受监管的工作流而言,前沿模型的准确率是一条无人通知即自行移动的合规边界。我们提出Aethis Eligibility Module,一种神经符号架构:LLM从权威来源撰写规则,再由基于SMT的层确定性地执行这些规则,其行为始终与所撰写的规范一致,不受模型漂移、推理努力默认值或提示格式的影响。三方面证据基础:(i)一个覆盖四个监管领域、含225个场景的受控基准记录了这一模式,以及复现中部分关闭该模式的漂移;(ii)在建筑保险上的20场景对抗性扩展中,该引擎取得20/20,四个前沿配置中的一个(低推理努力的GPT-5.4)同样如此,而其余三个(包括评估当时Anthropic最强的模型)均未通过同样的覆盖缺口边缘案例;(iii)在九个经同行评审的LegalBench任务、949个留出案例上的外部验证中,该引擎显著比全部三个前沿模型更准确(合并McNemar p <= 0.003),在精选的多分支任务上相对Anthropic模型的领先幅度高达41个百分点。其贡献在于把不确定性从推断边界(在那里它是无声的)转移到规范边界(在那里它是审慎且经过审计的)。所有场景、规则编码与结果均公开且可复现。