论文

LLM理解顺序结构吗?推理和生成的对照研究

Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用作交互式智能体和模拟器,但目前尚不清楚它们是否可以恢复表面作用频率之外的潜在序列结构。这种区别对于行为模拟至关重要,行为模拟通常是由先前的上下文而不是仅由边际频率决定的。我们使用受控的两人石头剪刀布交互和单人随机 n-gram 延续任务来研究这个问题。在这些实验中,我们测试LLM是否可以识别潜在策略、遵循简单的马尔可夫规则并维持高阶条件依赖性。我们的框架将分布匹配与条件规则遵循分开。结果表明,较长的上下文并不能改善识别,正确的识别不能确保忠实的模拟,并且高阶依赖性会显着降低规则恢复能力。因此,明显的行为忠诚度可能掩盖不正确的生成机制。