论文

语义基元作为大语言模型情绪的解释项

Semantic Primes as Explanans for Emotion in Large Language Models

模型评测模型行为与机制分析

摘要

理解大语言模型(LLM)的情绪机制已有进展。但如何解释LLM中的情绪、乃至什么构成好的解释,仍不清楚。情绪表示、组件与回路广泛可恢复,但作为模型自身计算的解释它们是循环的;情绪空间维度往往任意且无终止。一个紧迫的问题是:是否存在一组更原初的内部变量在起作用——自然语义元语言(NSM)的语义基元。在四个指令微调LLM(Llama-1B、Gemma-2B、Gemma-9B、OLMo-7B)上的实验显示:NSM基元(1)是可恢复的内部元素;(2)在参考模型上,以基元方向做干预对情绪的控制强度约为最佳评价方向的三倍、选择性约两倍;(3)模型把基于基元的释义视为与对应情绪可互换。这些证据表明,按科学解释的标准,NSM基元似乎比许多替代选项更好地充当LLM情绪的解释项。

语义基元作为大语言模型情绪的解释项:论文配图
图 5:合成验证:在随机初始化的 12 层变压器的第 7 层植入的素数类型信号针对所有六个合成素数(尖峰)恢复;层外精度和长度基线是偶然的。