论文
LLM 代码生成的紧凑约束编码:词元成本和约束合规性的实证研究
Compact Constraint Encoding for LLM Code Generation: An Empirical Study of Token Economics and Constraint Compliance
摘要
用于代码生成的 LLM 通常受到以详细自然语言表达的工程约束(技术选择、依赖性限制和架构模式)的指导。我们研究紧凑的结构化约束标头是否可以减少即时词元消耗而不降低约束合规性。在涵盖 11 个模型、16 个基准测试任务和超过 830 个 LLM 调用的六轮实验中,我们发现紧凑标头将约束部分标记减少了大约 71%,将完整提示标记减少了 25--30%,这在三个独立轮次中得到了复制。然而,我们发现三种编码形式或四种传播模式的约束满足率(CSR)没有统计学上的显着差异;观察到的效应大小可以忽略不计(Cliff 的 $δ$ < 0.01,95% CI 跨越 $\pm$2.6 个百分点)。此空模式适用于来自不同功能层的两个模型。四个非 CSS 任务的补充实验为编码空结果提供了额外的跨域支持。观察到的最大合规性方差来源是约束类型($Δ$ = 正常约束和反直觉约束之间的 9 个百分点)和任务域:与模型默认值相反的反直觉约束在 10--100% 时失败,而无论编码如何,传统约束都实现 99% 以上的合规性。模型自我评估系统地高估了相对于基于规则的评分的合规性,揭示了约束理解和执行之间的差距。在测试条件下,紧凑约束编码的主要好处是减少词元而不是改进合规性,并且合规性的工程工作更好地针对约束设计而不是提示格式化。