论文
共享电路预测 LLM 是否可以在算术推理中跨格式泛化
Shared circuits predict whether LLMs generalize across formats in arithmetic reasoning
摘要
在包括算术推理在内的许多推理形式中,对输入格式的表面变化进行概括对于人类来说是毫不费力的:任何能够解决 2+5 问题的人也可以解决“二加五”问题。相比之下,LLM 对于提示的表面变化更脆弱:例如,它们几乎完美地解决了数字算术问题,但在相同问题的口头表达上却不太准确。在这里,我们询问是否可以从模型的内部预测跨格式的泛化。使用归因修补,我们首先以三种语言独立定位每个模型用于解决数字算术问题 (2+5) 与口头算术问题的电路:英语(“二加五”)、西班牙语(“dos más cinco”)和意大利语(“due più cinque”);然后,我们测试与模型自身数字电路的重叠是否可以预测其对语言格式的泛化。事实上,我们在三个层面上找到了对这一想法的支持:电路重叠解释了三种语言格式的相对难度,哪些模型概括得最好,哪些项目能够正确解决,与监督探针相媲美,同时不需要标记数据。