论文
约束解码消除了小型大语言模型的结构性故障,但揭示了与规模相关的语义差距
Constrained Decoding Eliminates Structural Failures in Small LLMs but Reveals a Scale-Dependent Semantic Gap
摘要
0.6B-4B 参数范围内的小型开源大语言模型 (LLM) 越来越多地部署用于结构化输出生成(JSON、函数调用、数据提取),但人们对约束解码 (CD) 如何与此体系中的模型规模交互知之甚少。我们在三种解码条件(本机、Outlines、XGrammar)下对来自三个系列的 5 个模型在 14 个结构化输出任务中进行了基准测试。我们引入了双轴评估,将结构正确性(模式有效性)与语义正确性(内容准确性)分开。我们发现 CD 消除了所有模型中的所有结构故障(模式有效性:78.6-92.9% 到 100%),但内容准确性揭示了与规模相关的持续语义差距:类型强制故障是完全 CD 可挽救的,而指令语义故障(例如,多步函数调用)仍然具有 CD 抵抗性。模式一致性是必要的,但对于语义正确性来说还不够; CD 的范围恰好结束于模式一致性结束的地方。