论文

位置与内容之辨:分解大语言模型生成结构化输出中的结构性失败与内容性失败

Where vs What: Decomposing Structural and Content Failures in LLM-Generated Structured Outputs

模型评测模型训练强化学习评测方法与指标RLVR

摘要

JSON和表格等结构化输出是现代基于大语言模型系统的核心,但生成失败通常被整体评估,混淆了两种不同的错误模式:放置错误(正确的值出现在错误的位置)与取值错误(预期位置上出现错误的值)。我们提出结构-内容分解(SCD)框架,独立度量结构保真度与内容准确性。将SCD应用于六个模型(从7B到前沿模型)的嵌套JSON与表格任务,我们发现一个一致现象:随复杂度上升,结构保真度比内容准确性更早、更急剧地退化。在最高复杂度下,即使是DeepSeek-V4-Flash(开启推理)也会放错35%的已召回值,而Qwen2.5-7B放错74%。受控消融实验提示,这种模式与依赖语义捷径而非对输出结构的拓扑理解有关。基于这些发现,我们提出SA-RLVR,通过GRPO将SCD指标转化为强化学习的可验证奖励。SA-RLVR成功优化了不同拓扑下的结构寻址:将JSON值放置准确率(VPA)从26%提升至63%,并能泛化到保留模式(held-out schemas);此外,它在表格领域也持续带来VPA提升,表明结构感知奖励能够直接增强多领域的结构定位能力。

位置与内容之辨:分解大语言模型生成结构化输出中的结构性失败与内容性失败:论文配图
图1:结构化生成中“值正确、位置错误”失败模式的示意图。LLM 能正确回忆所有植入的值,却将其放在错误的结构位置上。上:JSON 领域:值在同级路径之间互换。下:表格领域:值迁移到错误的行列坐标。现有的整体性指标无法检测这种失败模式。