论文
抵抗并更新:激励兼容LLM的反事实报告坐标
Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
摘要
对齐的语言模型在非证据压力下常误报:面对自信的用户就屈服,而真证据到来时却不修订。我们把它归为内部激励不兼容的失败,在已知后验的贝叶斯见证基准上研究“抵抗”(无视被禁止的压力)与“更新”(遵循获许可的证据)两种要求——同一用户异议仅凭陈述的来源可靠性即为证据或压力,按构造消除证据/压力混杂。使用交换干预而非探针,我们把答案、信心与保留意见的低秩报告坐标因果定位到晚期干预位点——确立因果充分性而非唯一性或必要性,并以因果串扰矩阵展示强自身坐标控制与仅小的交叉效应(部分功能解缠)。随后我们引入免训练的反事实报告坐标(CRC)钳位:参照模型自身在提示的激励中和反事实下的报告。双遍全窗钳位使抵抗与更新同时达到1.00(Wilson 95% CI [0.99,1.00];仅秩16投影达0.88/0.90)——我们把它读作在可构造参照下的因果证书与上界,而非已部署方案的声明。测试过的全局解码与固定方向转向都会以一个目标换另一个目标,仅抵抗训练把更新塌缩到0.01。可部署的单遍编译有损(0.73/0.97)。机制与钳位跨三个模型家族复现,并迁移到自然谄媚基准、取得显著配对改进。我们的贡献是接口与认证方法:激活级的反事实激励不变性作为内部激励兼容的结构原语。
