论文
可观察的模式不是解释:潜在推理模型的因果几何分析
Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models
摘要
潜在推理模型(LRM)用连续的思维取代了明确的思维链。最近的工作将可观察的潜在状态模式(例如类似 BFS 的边界和可解码的算术计算)视为内部推理机制的证据。根据缺乏建议的重复或课程的对照评估两种 LRM(椰子和 CODI),我们发现这些模式也出现在对照中,并且并不总是对行为产生因果影响。因果干预表明,潜在思想的利用不是二元的,而是分级的,随着思想对模型行为的因果影响而缩放。几何分析表明,这种效应集中在低秩方向,随着行为影响力的增加,其逐步几何结构变得更加结构化。因此,潜在思想应该被视为隐藏计算,而不是隐藏解释:可解码性、注意力或静态结构本身无法建立机制。因此,LRM 的可解释性需要匹配的对照和因果检验。