论文
标量多样性的连续解释指导
Continuous Interpretive Steering for Scalar Diversity
摘要
语用推理本质上是分级的。不同的词汇项目会带来不同程度的语用丰富。标量蕴涵通过标量多样性体现了这一属性,其中蕴涵强度因标量项而异。然而,大语言模型 (LLM) 中的语用推理评估通常依赖于基于提示的操作。除了提示级效果之外,本研究还引入了连续解释引导(CIS),这是一种通过将激活级别引导强度视为连续实验变量来探索分级语用解释的方法。为了支持这一分析,本研究引入了一个新的数据集 GraSD,它编码分级标量多样性。对四个 LLM 的实验表明,统一的激活引导在全局范围内增加了实用解释,但会瓦解项目级别的变化,而分级激活引导会产生与标量多样性等级一致的差异化解释转变。它表明分级敏感性被编码在表示空间中,并且可以通过受控干预系统地恢复。 CIS 和 GraSD 共同提供了一个原则框架,用于评估 LLM 中的分级语用敏感性。