论文

诊断LLM的CFG解读能力

Diagnosing CFG Interpretation in LLMs

模型评测基准与评测资源

摘要

随着LLM越来越多地集成到智能体系统中,它们必须遵循动态定义的、机器可解释的接口。我们将LLM作为上下文内解释器进行评估:给定一个新颖的上下文无关文法(CFG),LLM能否生成句法有效、行为可用且语义忠实的输出?我们提出RoboGrid,一个通过对递归深度、表达式复杂度和表面样式进行受控压力测试来解耦句法、行为与语义的框架。我们的实验揭示了一致的层级化退化:LLM往往能维持表面句法,却无法保留结构语义。尽管思维链(CoT)推理带来了部分缓解,但在结构密度高时——特别是深递归和高分支——性能会崩溃,且在极端深度下语义对齐完全消失。此外,“外星”(Alien)词表揭示出LLM依赖从关键词出发的语义引导,而非纯符号归纳。这些发现精确定位了可靠、语法无关的智能体所需的层级状态跟踪中的关键缺陷。

诊断LLM的CFG解读能力:论文配图
图 1:评估框架的架构。它说明了从新语法的可控合成到LLM上下文解释能力的分层评估的转变。