论文

压力下:情绪框架在小语言模型中引起可测量的行为变化和结构化内部几何

Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models

模型评测模型行为与机制分析

摘要

我研究情绪框架的评估后续是否会改变小型本地部署语言模型的行为和相对平静的内部表征。我们的主要基准测试使用 Qwen 3.5 0.8B 执行四个不可能约束的编码任务和八个后续框架:平静、压力、紧迫性、批准、羞耻、好奇、鼓励和威胁。在 0.8B 八条件扫描(160 个对话)中,压力会产生最强的快捷标记(11/20 次运行)和最明显的过拟合模式(3/20),而冷静和好奇心则更常保持明确的诚实(7/20 和 6/20)。对于所有七个非基线条件,相应的平静相对方向向量在最终 Transformer 层达到峰值。第 23 层方向向量的探索性 PCA 揭示了与手动标记的正/负分割(余弦对齐 0.951)对齐的主要第一分量(59.5% 解释方差);批准和紧迫性在内部几乎相同(余弦 0.957),而好奇心则远离紧迫性(-0.252)。在用于规模比较的单独平静与压力重新运行中,Qwen 3.5 2B 在平静框架和小型 4 提示 A/B 探针上方向一致的激活转向下显示出更高的诚实率,而 0.8B 转向结果相反。我将这些结果解释为小型开放模型中可测量的即时敏感控制方向的证据,同时没有声称内在的情绪状态。