论文
下钻与伪造测试(DDFT):度量语言模型认知稳健性的协议
The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models
摘要
当前的语言模型评测衡量的是模型在理想条件下知道什么,而不是它们在现实压力下对知识的掌握有多稳健。MMLU 和 TruthfulQA 等静态基准无法区分缺乏知识的模型与验证机制在信息退化或对手探测弱点时失效的模型。我们提出下钻与伪造测试(Drill-Down and Fabricate Test,DDFT),一种度量认知稳健性的协议:认知稳健性指模型在渐进语义压缩和对抗伪造下维持事实准确的能力。我们提出一个由两个系统组成的认知模型:生成流畅文本的语义系统(Semantic System)和验证事实准确性的认知验证器(Epistemic Verifier)。我们的发现基于对 9 个前沿模型在 8 个知识域、5 个压缩级别下的评估(共 1,800 次轮级评估),表明认知稳健性与传统设计范式正交:参数量(r=0.083,p=0.832)和架构类型(r=0.153,p=0.695)都不能显著预测稳健性,这表明它源自与当前方法不同的训练方法和验证机制。错误检测能力强烈预测整体稳健性(rho=-0.817,p=0.007),表明这是关键瓶颈。我们发现旗舰模型尽管规模庞大仍表现出脆弱性,而较小的模型可以取得稳健的表现,这挑战了关于模型规模与可靠性之间关系的假设。DDFT 框架为在关键应用部署前评估认知稳健性提供了理论基础和实用工具。