论文

UniCog:通过潜在心智空间分析揭示LLM的认知能力

UniCog: Uncovering Cognitive Abilities of LLMs through Latent Mind Space Analysis

模型评测模型行为与机制分析

摘要

越来越多的研究表明,大语言模型(LLM)的认知过程与人类存在根本差异。然而,现有可解释性方法在解释LLM推理过程中认知能力如何被调用方面仍然有限。本文提出UniCog,一个通过潜在心智空间分析LLM认知的统一框架。UniCog被构建为潜在变量模型,将来自密集模型激活的多种能力编码为稀疏、解耦的潜在维度。通过对包括DeepSeek-V3.2和GPT-4o在内的六个先进LLM的广泛分析,我们揭示了LLM认知的帕累托原则:一个共享的推理核心由能力专属的特征所补充。此外,我们发现推理失败常常表现为潜在激活中的异常强度。这些发现开启了LLM分析的新范式,提供了以认知为依据的推理动态视角。最后,利用这些洞见,我们提出一种潜在信息引导的候选优先级策略,在多个具有挑战性的基准上将推理性能提升最高7.5%。我们的代码发布于 https://github.com/milksalute/unicog。

UniCog:通过潜在心智空间分析揭示LLM的认知能力
图1:以往可解释性方法与我们的 UniCog 框架的对比。