论文
语义基元作为大语言模型情绪的解释项
Semantic Primes as Explanans for Emotion in Large Language Models
摘要
理解大语言模型(LLM)的情绪机制已有进展。但如何解释LLM中的情绪、乃至什么构成好的解释,仍不清楚。情绪表示、组件与回路广泛可恢复,但作为模型自身计算的解释它们是循环的;情绪空间维度往往任意且无终止。一个紧迫的问题是:是否存在一组更原初的内部变量在起作用——自然语义元语言(NSM)的语义基元。在四个指令微调LLM(Llama-1B、Gemma-2B、Gemma-9B、OLMo-7B)上的实验显示:NSM基元(1)是可恢复的内部元素;(2)在参考模型上,以基元方向做干预对情绪的控制强度约为最佳评价方向的三倍、选择性约两倍;(3)模型把基于基元的释义视为与对应情绪可互换。这些证据表明,按科学解释的标准,NSM基元似乎比许多替代选项更好地充当LLM情绪的解释项。
