论文
没有语义的语法:教 大语言模型 用看不见的语言编写代码
Syntax Without Semantics: Teaching Large Language Models to Code in an Unseen Language
摘要
大语言模型 (LLM) 在代码生成基准上实现了很高的通过率,但他们是否可以将这种能力转移到没有预训练的语言上仍然知之甚少。我们引入了 PyLang,一种所有预训练语料库中都没有的最小命令式语言,并针对 352 个问题评估了零样本和微调的 Qwen3(4B、8B、32B)前沿模型。我们发现 微调 可以快速教授语法,但无法传递语义能力:在所有配置中,Python 的性能比 PyLang 高出 19%,并且没有干预(多任务学习、偏好调整、代码填充或潜在空间目标)来缩小差距。 LLM 法官透露,前沿模型在 80% 的情况下会选择与 Python 相同的算法,但无法将其转换为有效的 PyLang 实现。CKA 分析证实,经过微调的模型跨语言收敛到几乎相同的内部表示(CKA > 0.97),但在输出阶段却出现分歧。我们将其称为实现保真度差距:模型具有与语言无关的算法理解,但无法用不熟悉的语言表达它。我们的研究结果强调需要将推理与特定语言的实现分离的训练方法。