论文

Aletheia:用正则化逆混淆矩阵量化推理模型的认知信念

Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix

模型评测评测方法与指标

摘要

在迈向人工通用智能(AGI)的进程中,当前的评测范式正面临认识论危机。静态基准测量知识广度,却无法量化信念的深度。虽然Simhi等人(2025)在标准问答中定义了CHOKE现象,我们将其框架扩展到量化System 2推理模型中的“认知信念”(Cognitive Conviction)。我们提出Project Aletheia,一个采用Tikhonov正则化来求逆评测者混淆矩阵的认知物理框架。为在不依赖不透明私有数据的情况下验证该方法,我们实现了一个合成代理协议(Synthetic Proxy Protocol)。我们对2025年基线模型(如DeepSeek-R1、OpenAI o1)的初步试点研究表明,推理模型在充当“认知缓冲器”的同时,可能在对抗压力下表现出“防御性过度思考”(Defensive OverThinking)。此外,我们引入对齐信念分数(Aligned Conviction Score, S_aligned),以验证信念不损害安全性。这项工作可作为测量AI科学诚信的蓝图。