论文
一个支持受控实验的小规模自回归程序合成系统
A Small-Scale System for Autoregressive Program Synthesis Enabling Controlled Experimentation
摘要
用训练来完成真实程序的小模型能开展什么研究?通常,研究者借助大语言模型(LLM)研究程序合成,而这引入了诸如难以判断什么在分布内或分布外、难以理解微调效应、难以理解分词效应,以及开展实验对算力与存储需求更高等问题。我们提出一个名为Cadmus的系统,包含一个整数虚拟机(VM)、一个由多任务真实程序构成的数据集,以及一个训练成本不足200美元的自回归transformer模型。该系统可用于研究程序补全、分布外表征、归纳推理与指令遵循,并且研究者能以有效且可负担的方式细粒度控制训练分布,还能检视与插桩模型。让更小的模型处理复杂推理任务,使得在大模型上可能昂贵到无法承受的插桩与研究成为可能。为证明这些任务足够复杂、足以引起兴趣,我们展示Cadmus模型在一个简单任务——在我们领域特定语言(DSL)中补全正确的整数算术程序——上超过GPT-5(达到100%准确率,而GPT-5为95%),同时对数据集与问题的关系保持透明。我们还展示GPT-5在求解相同任务时会把未知先验带入其推理过程,这构成一个混淆因素,阻碍了在某些需要完全理解训练集与任务关系的研究中使用大规模LLM。
