论文

Copy-as-Decode:用于大模型编辑的语法约束并行预填充

Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing

模型推理解码与生成控制

摘要

大模型编辑文本和代码时,通常自回归生成完整输出,即使大部分词元与输入完全相同。我们研究Copy-as-Decode,将编辑重述为由两种原语组成的结构化解码:<copy lines="i-j"/>引用输入行范围,<gen>...</gen>生成新内容。词元级有限状态机保证语法有效,服务层通过一次并行预填充前向计算更新复制片段的KV缓存,替代N次自回归步骤。它复用推测解码的并行前向内核,但以输入词元作草稿,并用程序强制接受替代概率核验。我们给出无需端到端训练的上界分析。(1)内核加速:在Qwen2.5-1.5B和7B、A100 80GB bf16条件下,并行预填充复制8至512个词元比自回归快6.8至303倍。(2)复制上限:在ProbeEdit和HumanEvalPack-Fix的Python/JavaScript任务上,行级原语可覆盖74%至98%的目标词元;结合各语料的片段长度分布与实测内核速度,得到实际运行时间加速上界29.0、3.4和4.2倍,合并为13.0倍。词元级扩展可覆盖91%至99%,加速下界为4.5至6.5倍。(3)流水线无损性:482个案例的理想参考程序均能经确定性解析器完整往返,将下游错误定位到片段选择,而非机制本身。加入偏移一位的噪声后,汇总精确匹配率从100%降至15.48%。在Qwen2.5-Coder-1.5B上的微调试验将HEvalFix-Py精确匹配率从未经训练时的0/33提高至12%至17%,表明初步可学习性,而不是已可用于生产的片段选择器。批量服务集成与多文件覆盖留作后续工作。