论文
大模型潜在语义流形中Voronoi划分的几何性质
Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models
摘要
语言模型处理离散词元,却在连续向量空间中计算,在表征流形上形成Voronoi划分。本文在Qwen3.5-4B-Base上实证研究该划分,有两项贡献。首先,以float32重新计算决策间隔,消除bfloat16量化伪影,验证Mabrok(2026)提出的表达能力差距线性尺度规律,R²=0.9997。在中间层24–28层,间隔几何与交叉熵负相关(ρ=−0.29),最终层则转为正相关(ρ=0.836)。其次,研究表明已收敛模型的Voronoi划分可通过间隔细化程序(MRP)重塑:用短时后处理优化扩大词元决策间隔,无需重新训练。研究在不同干预强度下比较直接间隔最大化与Fisher信息距离最大化。两者在每256K个评估位置上均达到约16,300个可纠正位置的上限,但附带损害不同。直接最大化间隔时,损害随干预强度上升,最终抵消纠正收益。Fisher方法在验证范围λ=0.15–0.6内,受损位置约保持5,300个;λ=0.6时,中位间隔改善28%,下游基准保持不变。该几何重组缩小了表达差距,同时保留其尺度规律。不过,频率与词元类别检查发现,收益主要集中在高频结构词元:λ=0.6时,其占净纠正的84%,内容和实体词元的贡献随λ升高而缩小。因此,Fisher MRP可作为几何细化工具,其实用上限取决于收益是否均匀覆盖不同词元,而非仅看总体损害。