论文

以表征控制 LLM 风险自述与实际行为的一致性

Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking

模型评测模型行为与机制分析

摘要

自我报告是 LLM 的 行为倾向 的一个有吸引力的低成本 探针,但最近的工作发现模型报告的内容和它们的行为方式之间只有选择性的一致性。先前的帐户通过提示黑盒 LLM 来建立这些模式,无论该间隙是提示人工制品还是有关底层构造如何在内部表示的事实,都保持开放状态。我们研究了冒险行为,这是 Agentic 决策的一个重要维度,使用激活引导来衡量相同内部干预下的自我报告和行为。我们调查了九种引导向量提取方法,涵盖特定于任务的指令、模型自身的任务行为和两个粒度的处置描述,并在四个 开放权重 LLM 的两个行为任务和两个心理测量仪器上进行评估。我们发现(1)共享的内部干预并不能确保共享的响应性:根据特征描述构建的方向会移动自我报告,但留下行为 处于随机水平,根据模型自己的任务选择构建的方向则相反,并且只有特定于任务的指令才能较弱地达到两者。 (2) 诊断消除了这种例外:消除表面混杂因素使指令仅发挥 32% 的行为效果。这两个通道由近乎正交的方向控制,每个通道都可以通过几个独立的结构到达。 (3) 由一种行为驱动和一种自我报告驱动方向组成的干预措施使两者共同驱动;翻转一个标志会使它们处于对立状态,在所有模型中,69-89% 的翻转组合中报告和实施的风险指向相反的方向。这些发现将自我报告与行为的关系从黑箱观察转变为可以检查和控制的代表性关系,从而激发了代表性检查和行为评估。

以表征控制 LLM 风险自述与实际行为的一致性的原论文方法或结果图
图 1:诊断和控制自我报告行为分离。我们比较了四个系列的九种指导方法:任务指令、模型决策、特定风险特征和大五特征。在四个 LLM、两个行为任务和两个自我报告工具中,我们测试(RQ1)转向是否将两个通道一起移动; (RQ2) 使用词汇控制、投影和 消融 解离是否反映了捷径、几何分离或下游依赖性; (RQ3) 撰写方向是否可以恢复连贯性或引起反连贯状态。