论文

抽样揭示风格:大语言模型激活中即时条件风格轴的无监督、免训练发现

Sampling Reveals Style: Unsupervised, Training-Free Discovery of Prompt-Conditional Stylistic Axes in LLM Activations

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 在其隐藏激活中编码丰富的风格结构,但发现对于给定提示哪些风格维度是显着的,通常需要有监督的对比数据。我们提出了一种免训练、有提示条件的替代方案:我们在高温下重复采样单个提示的完成情况,将主成分分析(PCA)应用于池化的隐藏激活,并从极点生成中自动标记结果轴。我们在一项两阶段研究中根据 245 个人类引发的风格注释验证了发现的轴。在我们最强的模型 (Qwen-3.5-4B-Instruct) 上,前两个轴以 72.8% 的精确度和 43.6% 的宏观召回率与自发要求的人类尺寸相匹配,75.6% 的有效性评级判断轴的极坐标代与其标签准确,相邻注释者间一致性为 90.9%。可发现性强烈依赖于模型:Qwen 模型和 Llama-3.2-3B 都暴露了人类显着轴,而 DeepSeek-7B-Chat 的精度下降到 35.3%,其主要组件由结构而不是风格差异主导。因此,对模型自身解码方差的简单 PCA 是对 LLM 表示中的风格结构的一种有效、低成本的探测,同时也暴露了结构组织方式方面的尖锐的跨模型差异。