论文
大语言模型 隐藏状态中的分类感知:位数边界处的结构扭曲
Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries
摘要
类别感知(CP)——类别边界的辨别力增强——是知觉心理学中研究最多的现象之一。本文报告了在处理阿拉伯数字的 大语言模型 (LLM) 的隐藏状态表示中发生了类似的几何扭曲。通过对来自 5 个架构系列的 6 个模型进行表征相似性分析,研究发现 CP 加法模型(对数距离加边界提升)比纯连续模型在每个测试模型的 100% 主层上更适合表征几何。该效应特定于结构定义的边界(10 和 100 处的数字计数转换),在非边界控制位置不存在,并且在语言类别(热/冷)缺乏标记化不连续性的温度域中不存在。出现了两个性质不同的特征:“经典 CP”(Gemma、Qwen),其中模型明确分类并显示几何扭曲;以及“结构 CP”(Llama、Mistral、Phi),其中几何在边界处扭曲,但模型无法报告类别区别。这种分离在边界上是稳定的,并且是架构的属性,而不是刺激。结构输入格式的不连续性足以在 LLM 中产生分类感知几何,独立于显式语义类别知识。