论文

评估语言模型中表示引导的语义特异性

Evaluating the Semantic Specificity of Representation Steering in Language Models

模型评测评测方法与指标

摘要

局部表示引导 (LRS) 广泛用于纠正 大语言模型 中的推理病态。然而,标准基准评估很容易被肤浅的标签覆盖所愚弄,造成推理电路修复的错误印象。在这项工作中,我们提出了跨规则转移(CRT),这是一种诊断框架,通过在模型本身具备能力的规则族上进行评估来审核代表性干预措施。评估后期层 LRS 是否存在广泛的逻辑故障(矛盾盲目性),表明干预措施只是注入了全局标签偏差:将引导向量应用于模型已经正确处理的规则(99.6% 基线),通过强制错误的矛盾预测,将性能降低至 40.4%。我们通过四种补充控制(直接 logits 偏差等价、控制向量标签翻转、跨模型移植和早期层转向检查)来支持这种诊断,提供严格的方法来区分真正的推理修复和表面标签覆盖。