论文
超越训练分布:映射神经程序合成中的泛化边界
Beyond the Training Distribution: Mapping Generalization Boundaries in Neural Program Synthesis
摘要
大规模 Transformer 在程序综合基准上取得了令人印象深刻的结果,但其真正的泛化能力仍然因数据污染和不透明的训练语料库而被掩盖。为了严格评估模型是否真正泛化或仅仅是检索记忆的模板,我们引入了基于特定领域算术语法的严格控制的程序合成环境。通过系统地枚举和评估数百万个独特的程序,我们构建了可解释的句法和语义度量空间。这使我们能够精确地映射数据分布以及隔离特定分布变化的样本训练和测试分割。我们的实验表明,优化密度泛化——通过语义和句法空间上的不同采样——可以产生鲁棒的分布外泛化。相反,评估支持泛化表明,Transformer 严重难以外推,当被迫生成语法新颖的程序时,性能下降了 30% 以上。虽然稳步扩展计算可以提高泛化能力,但增益遵循严格的对数线性关系。我们的结论是,鲁棒的泛化需要最大化多个流形上的训练多样性,我们的研究结果表明有必要采用基于搜索的新颖方法来突破当前的对数线性扩展瓶颈。