论文

知识知道,语言化告诉:解开 LLM 中数学可解性的潜在方向

Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

模型评测模型行为与机制分析

摘要

尽管 LLM 在数学推理方面取得了重大进展,但确定数学问题是否可解仍然是一项基本但具有挑战性的能力。虽然最近的研究探讨了模型可解性信念的内部表征,但语言化主要是从行为角度而不是作为内部表征进行研究,这限制了其分析和操作。我们通过分别探索可解性知识和语言化的表示来解决这一差距,使我们能够在模型隐藏状态中解开两者。在多个 LLM 中,我们表明知识和言语被编码为不同的、可线性解码的表示,并且制造主要与言语的变化而不是底层知识相关。用不可解决的线索进行提示主要通过改变言语来减少制造,而激活引导则表明可以机械地操纵这些表示以改善模型的放弃。