论文
形式化潜在思想:LLM 中思想表示的四个公理
Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs
摘要
我们在 LLM 中引入了一个用于潜在思想表征的公理化评估框架,其中包含独立于下游基准分数的指标,并揭示基准准确性掩盖的表征失败。现有的评估将表示质量与模型能力混为一谈。因此,失败不能归因于表示,而是归因于处理它的模型。我们形式化了四个函数公理(因果性、极小性、可分离性和稳定性),并为每个公理定义了定量度量,直接在独立于下游精度的表示上计算。我们在 23 个推理任务(例如空间推理、事实 QA)中审核开放权重 LLM。我们发现没有候选者同时满足所有四个公理,表示可靠地区分任务类型,但无法区分同一任务中的两个问题,并且表示除了输入嵌入中已经存在的信息之外,只编码很少的信息。这种失败在密集的、推理提炼的和强化学习训练的模型系列中是一致的,这表明差距是结构性的,而不是模型大小或训练过程的属性。