论文

混合和非混合中的推理原语 LLM:架构差异是否会在状态跟踪和召回方面产生优势?

Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?

模型评测模型能力评测

摘要

大语言模型 中的推理通常作为单一功能进行讨论,但它的一些收益可能源于更简单的底层操作。我们通过以基于状态的召回为中心的五个受控任务系列来检查两个这样的原语:召回和状态跟踪,并比较匹配的 Transformer 和具有或不具有推理增强的混合架构。在整个套件中,推理增强变体的性能大大优于纯指令变体,而且往往差距很大。这种模式与“状态优于词元”的观点一致:外部化推理跟踪会有所帮助,因为它们在词元空间中向前传递中间状态。相比之下,一旦推理词元可用,混合归纳偏差就不会在准确性方面产生统一的优势。当架构差异确实出现时,它们遵循任务结构:混合 Think 模型在严格顺序链式更新上更加稳健,而 Transformer Think 模型在平面多跳检索上更加稳健。因此,我们将这项研究的主要贡献视为对基于状态的召回任务的性能驱动因素的描述性说明:推理标记增强似乎是主导因素,而混合优势更窄,依赖于任务,并且可能更多地与推理效率有关,而不是整体能力。我们还发布了重现这些结果所需的代码库和数据。