论文

没有理解的收敛:当语言模型在表示上一致但在推理上不一致时

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

模型评测模型行为与机制分析

摘要

在不同目标和架构下训练的 大语言模型 已被证明可以开发出越来越相似的内部表示,这种观察形式化为柏拉图表示假说。这种表征收敛是否会扩展到基于共享表征的推理过程仍有待测试。我们评估了 8 个系列的 16 个语言模型(1.5B 到 72B 参数)在 800 个涵盖数学、科学、常识和真实性的推理问题上的表征相似性,并按问题难度、计算阶段和因果相关性进行分层。我们的分析揭示了三种分离:难度倒置,其中模型更多地收敛于它们共同失败的问题(中心核对齐 [CKA] = 0.897),而不是它们解决的问题(CKA = 0.830);代沟,其中决策前表示一致(CKA = 0.875),而决策后表示分歧(CKA = 0.274);以及附带现象的正确性,其中共享信息可以跨模型进行解码(66% 的传输准确率),但对预测的因果影响最小(跨消融协议的翻转率为 1.5% 至 5.5%)。这些结果表明,语言模型中的表征收敛反映了共享的输入处理约束,而不是共享的推理策略,这对集成设计、可解释性迁移和模型相似性评估具有直接影响。代码可在 https://github.com/Usama1002/convergence-without-understanding 获取。