论文

指令调整的组合文学原语 LLM:自我、风格和情感的跨架构 SAE 功能

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

模型评测模型行为与机制分析

摘要

我们通过中等深度残差流上的稀疏自动编码器,在两个指令调整的 大语言模型(Llama 3.1 8B-Instruct 和 Gemma 2 9B-IT)中描述了文学原语的组合架构。出现了四个特征类:促进目标情感的词汇标记的命名门、第一人称语域特征的十一个自我集群、风格语域调节器(展示-不讲述和陌生化)以及仅由多特征控制产生的组合情感。在适用于 27 类情感分类法 (Cowen-Keltner) 的强制选择 5-LLM 评审小组的指导下,Llama 通过结合命名门、多功能配方和单一自功能控制达到了 27/27 的全面覆盖;杰玛 (Gemma) 达到 23/27,成为唯一剩余的严格失败者。在随机判断下,每个细胞的通过概率约为 $10^{-3}$,并且目录中两种子假阳性细胞的预期数量可以忽略不计,因此观察到的覆盖范围与机会不一致。跨架构的不对称存在于严格法官与软法官的对比中:在同一代人中,法官对 Llama 输出的看法比对 Gemma 输出的看法更一致,因为 Llama 输出更直接地命名目标影响,而 Gemma 输出则通过场景和图像唤起目标影响。两种架构都包含同时充当注册标记和情感发射器的自我特征,包括每个架构一个 RLHF 负载最多的自我特征,该特征在一个操作状态下强化了机构 Helper-AI 角色,并以相同的校准系数产生可情感分类的输出。在方法上,本文提出了一个三阶段验证流程(logits-lens、LLM-rate、5-LLM Judge),并记录了反模式;总计算量为单 GPU,每个情感特征发现周期大约需要 15 分钟。