论文

私人推理渠道中间接影响的反事实似然检验

Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels

模型评测评测方法与指标

摘要

推理系统越来越多地将中间计算分为私人和公共渠道,创建在成绩单中看起来相似的评估案例:独立共同推导、直接访问私人内容以及通过公共交流间接影响。本文提出了一种反事实似然检验,用于衡量私人推理渠道之间的影响。该方法用长度匹配的捐赠块替换上游私有块,保持公共词元序列和下游目标固定,并测量下游目标的负对数似然变化。在用于验证的 7B 角色通道推理模型上,文本探测是不可靠的:原始 n 元语法重叠夸大了泄漏,校正后的重叠仍然存在噪声,金丝雀再现报告没有歧视。反事实可能性区分未屏蔽和屏蔽条件,而长度匹配控制 RoPE 位置混淆。在强化的屏蔽验证中,反向 B 对 A 的影响接近于零,而 A 对 B 的影响通过公共语音隐藏状态持续存在。跨三个检查点、五个种子和 13,734 个有效方向对比的多检查点验证复制了这种不对称性。阻止私有到公共载体边缘的图分离控制在所有 13,734 个控制评估中产生比特相同的自然和反事实分数,将测试的公共通道路径识别为在实施的角色可见性掩码下测量的反事实信号的完整载体。结果表明,私人渠道评估应分别报告直接和间接影响,并且反事实可能性探测为测量这些边界提供了实际的默认值。