论文

StateSwap:探索多项选择题中的支持消除隐藏状态

StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice Questions

模型评测模型行为与机制分析

摘要

大语言模型 在支持导向和消除导向框架下提出相同的多项选择题时,经常会不一致地回答该问题。我们研究这些差异是否是由两个框架引起的不同内部表征引起的。我们引入了双框架协议,其提示的变化最少,使用支持或消除导向的框架,同时保持评估目标固定。为了探测内部计算,我们附加一个未经训练的特殊标记 [STATE],并将其剩余流激活视为干预接口。在这两个模型中,这两个框架诱导了集中在中间层的可分离的[STATE]激活。在配对提示之间交换这些激活可以系统地改变预测并提高跨框架一致性,从而提供基于干预的证据来证明激活与行为相关。除了实例级替换之外,从双帧对比度导出的平均差转向方向比评估协议下匹配的对比激活添加方向表现出更多有界的分层响应。