论文

从幻觉到结构滚雪球:LLM 反思中约束解码的对齐税

From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 中的内在自我校正经常因“幻觉滚雪球”而在开放式推理任务中失败,这是一种模型在自由文本反射期间递归地证明早期错误的现象。虽然结构化反馈可以缓解这个问题,但现有的方法通常依赖于外部训练的批评者或符号工具,从而减少了代理的自主权。本研究调查纯粹通过基于轮廓的约束解码强制结构化反射是否可以在无需额外训练的情况下破坏错误传播。通过评估 80 亿参数模型 (Qwen3-8B),我们发现简单地施加结构约束并不能提高自我校正性能。相反,它触发了一种称为“结构滚雪球”的新故障模式。我们发现满足严格的格式化规则所需的认知负荷将模型推入格式化陷阱。这一观察结果有助于解释为什么智能体实现了近乎完美的表面语法对齐,但却无法检测或解决更深层次的语义错误。这些发现暴露了受限解码固有的“对齐税”,凸显了自主工作流程中结构粒度和内部模型能力之间的紧张关系。代码和原始日志可在 GitHub 存储库中找到:https://github.com/hongxuzhou/agentic_llm_structed_self_critique。