论文
以表征控制 LLM 风险自述与实际行为的一致性
Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking
摘要
自我报告是 LLM 的 行为倾向 的一个有吸引力的低成本 探针,但最近的工作发现模型报告的内容和它们的行为方式之间只有选择性的一致性。先前的帐户通过提示黑盒 LLM 来建立这些模式,无论该间隙是提示人工制品还是有关底层构造如何在内部表示的事实,都保持开放状态。我们研究了冒险行为,这是 Agentic 决策的一个重要维度,使用激活引导来衡量相同内部干预下的自我报告和行为。我们调查了九种引导向量提取方法,涵盖特定于任务的指令、模型自身的任务行为和两个粒度的处置描述,并在四个 开放权重 LLM 的两个行为任务和两个心理测量仪器上进行评估。我们发现(1)共享的内部干预并不能确保共享的响应性:根据特征描述构建的方向会移动自我报告,但留下行为 处于随机水平,根据模型自己的任务选择构建的方向则相反,并且只有特定于任务的指令才能较弱地达到两者。 (2) 诊断消除了这种例外:消除表面混杂因素使指令仅发挥 32% 的行为效果。这两个通道由近乎正交的方向控制,每个通道都可以通过几个独立的结构到达。 (3) 由一种行为驱动和一种自我报告驱动方向组成的干预措施使两者共同驱动;翻转一个标志会使它们处于对立状态,在所有模型中,69-89% 的翻转组合中报告和实施的风险指向相反的方向。这些发现将自我报告与行为的关系从黑箱观察转变为可以检查和控制的代表性关系,从而激发了代表性检查和行为评估。
