论文
LLM 嵌入空间是否恢复专家结构?
Do LLM Embedding Spaces Recover Expert Structure?
摘要
预训练的文本嵌入越来越多地用作代表性地图,但高类别可分离性并不意味着它们的几何形状恢复专家定义的结构。我们用心理健康相关的语言来研究这个问题,其中症状关系提供了外部参考,在线社区引入了强大的领域、情感、风格和话语混淆。我们使用 28 个 Reddit 社区,比较了两个尺度(0.6B 和 4B)的预训练和监督微调 Qwen3 嵌入空间。我们构建类别原型,通过表征相似性分析根据专家症状矩阵评估其表征相异矩阵,并用基于原型的典型性和多基线混杂控制来补充此全局测试。预训练嵌入显示出与心理健康子集中的专家结构可测量的一致性; 微调 在最精细的品类级别上强化了这种一致性;更大的规模可以提高零样本对齐和监督引起的增益。在控制 VAD、LIWC、词汇风格和主题分布结构后,残差对齐仍然很重要。这些结果表明 LLM 嵌入可以恢复与专家相关的类别几何形状,但这种恢复是水平相关的,应该针对显式混杂进行测试,而不是单独从分类中推断。