论文

HyperLens:以细粒度置信轨迹量化LLM认知努力

HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

模型评测模型行为与机制分析

摘要

虽然大语言模型(LLM)在多样任务上表现强劲,但受限于既有分析工具的分辨率,其推理动力学仍知之甚少。本研究发现transformer架构中存在一种内在放大机制:更深的层天然放大逐层置信的微小变化,提供细粒度置信轨迹。基于该洞见,我们提出HyperLens:一个高分辨率探针,追踪置信轨迹并量化推理期间的认知努力。跨LLM与数据集,HyperLens揭示一致的置信轨迹分化:复杂任务与简单任务得以分离。我们把该模式抽象为定量的认知努力度量。分析揭示一个基本原理:复杂任务一致需要更高的认知努力。最后,我们给出标准监督微调(SFT)常见副作用的机制诊断:SFT会降低认知努力,从而损害域内任务性能。

HyperLens:以细粒度置信轨迹量化LLM认知努力:论文配图
图 1:不同焦深的 Qwen2.5-7B 在简单(CoNaLa(Yin 等人,2018))与困难(APPS(Hendrycks 等人,2021a))编码任务上的置信轨迹。三位数的置信度由(1)零焦深得出,相当于Logit Lens; (2)单层浅焦深; (3)足够的焦深,五层。