论文

一个支持受控实验的小规模自回归程序合成系统

A Small-Scale System for Autoregressive Program Synthesis Enabling Controlled Experimentation

模型评测基准与评测资源

摘要

用训练来完成真实程序的小模型能开展什么研究?通常,研究者借助大语言模型(LLM)研究程序合成,而这引入了诸如难以判断什么在分布内或分布外、难以理解微调效应、难以理解分词效应,以及开展实验对算力与存储需求更高等问题。我们提出一个名为Cadmus的系统,包含一个整数虚拟机(VM)、一个由多任务真实程序构成的数据集,以及一个训练成本不足200美元的自回归transformer模型。该系统可用于研究程序补全、分布外表征、归纳推理与指令遵循,并且研究者能以有效且可负担的方式细粒度控制训练分布,还能检视与插桩模型。让更小的模型处理复杂推理任务,使得在大模型上可能昂贵到无法承受的插桩与研究成为可能。为证明这些任务足够复杂、足以引起兴趣,我们展示Cadmus模型在一个简单任务——在我们领域特定语言(DSL)中补全正确的整数算术程序——上超过GPT-5(达到100%准确率,而GPT-5为95%),同时对数据集与问题的关系保持透明。我们还展示GPT-5在求解相同任务时会把未知先验带入其推理过程,这构成一个混淆因素,阻碍了在某些需要完全理解训练集与任务关系的研究中使用大规模LLM。

一个支持受控实验的小规模自回归程序合成系统
图1:图中展示了Cadmus-280M-80M-v1模型在分布内与分布外情况下预测正确比较用X值与Y值的准确率。在给定附录A所示指令和2k输出token的条件下,图中针对GPT-5模型展示了Cadmus-280M-80M-v1的领域内分布。当提供以替代形式描述这些指令的正确指令时,GPT模型无法使用2k输出token给出有用的回答(详见附录图3)。在所有情形中,所报告的准确率均通过在每个像素(即每个X,Y值对)上测试10个验证程序获得。