论文

几何金丝雀:通过表征稳定性预测可操纵性并检测漂移

The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability

模型评测模型行为与机制分析

摘要

语言模型的可靠部署需要两种看似不同但具有共同几何基础的功能:预测模型是否会接受有针对性的行为控制,以及检测其内部结构何时退化。我们证明了几何稳定性,即表示成对距离结构的一致性,可以解决这两个问题。测量与任务相关的几何稳定性的有监督 Shesha 变体在 35-69 个嵌入模型和三个 NLP 任务中以近乎完美的精度 ($ρ= 0.89$-$0.97$) 预测线性可操纵性,捕获超出类可分离性的独特方差 (部分 $ρ= 0.62$-$0.76$)。出现了一个关键的分离:无监督的稳定性完全无法指导现实世界的任务($ρ\大约 0.10$),这表明任务对齐对于可控性预测至关重要。然而,无监督稳定性在漂移检测方面表现出色,在 后训练 对齐期间测量到比 CKA 大近 2 倍的几何变化(在 Llama 中高达 5.23 倍),同时为 73% 的模型提供早期警告,并保持比 Procrustes 低 6 倍的误报率。监督和非监督稳定性共同构成了 LLM 部署生命周期的补充诊断:一个用于部署前可控性评估,另一个用于部署后监控。