论文

量化重塑语言模型的元认知几何

Quantisation Reshapes the Metacognitive Geometry of Language Models

模型评测模型行为与机制分析

摘要

我们报告模型量化重构了 LLM 中的域级元认知效率,而不是统一降低它。以 Q5_K_M 和 f16 精度评估 Llama-3-8B-Instruct 上相同的 3,000 个问题,我们发现四个知识领域的 M 比率配置文件在格式之间不相关(Spearman rho = 0.00)。艺术与文学从监控最差(Q5_K_M 处的 M 比率 = 0.606)变为监控最好的(f16 处的 1.542)。地理位置从监控良好 (1.210) 变为监控不足 (0.798)。然而,Type-2 AUROC 配置文件在不同格式 (rho = 1.00) 中完全稳定,将重构定位到 M 比率归一化而不是基础判别信号。这一发现源于一项预先注册的尝试,旨在通过领域条件训练来改善元认知。我们为诊断出的薄弱领域规定了置信放大 SFT,并采用匹配预算不可知和错误处方控制。所有四个验证性假设均无效(10,000 次引导重采样,种子 = 42)。训练成功地重塑了置信度分布,将 Science 中的 NLP 差距从 0.076 增加了一倍到 0.152,但并没有改善 meta-d',因为诊断配置文件没有跨格式转移。任何依赖域级 M 比率配置文件的系统都对推理格式有未经审查的依赖。使用 AUROC_2 的系统更安全。我们发布所有代码、预注册和试用级数据。