论文
他们推断你的意思:模型代表的沟通意图比他们采取的行动更可靠
They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It
摘要
当一个人与语言模型分享某些内容时,该模型通常会回答消息的表面,而不是发送者通过发送消息所做的事情:共享已完成的项目并批评代码;共享一条原始的深夜线路,它会进行健康检查。我们将发送者的交流意图(Gricean 的含义)视为一流的可解释性对象,并表明失败是在稳健表示之上的读出之一。线性探针可以从模型的默认通过隐藏状态中干净地、独立于表面地跨六个模型和四个系列以及在基本检查点中解码发送者的意图,无论他们想要识别还是评估某个事物。该表示进一步概括为仅从实用角度推断的意图,以及第二个词汇干净的意图(支持与帮助)。故事的行为部分以及每个因果测试都是建立在识别/评估对比的基础上的,其中不同的是默认输出是否按照意图起作用。读出滞后于模型内的深度表示(意图在驱动输出之前可解码几层);跨模型,默认情况下对其起作用的模型是特定于模型的,这是一种观察到的分层(六分之三显示失败),我们不将其视为缩放法则。在间隙开放的情况下,与表示紧密相关的方向,即搜索层的判别方向,是一个因果句柄:控制它可以恢复预期的行为,就像明确的指令一样,并且根本没有提示。该方向与反馈提供轴接近正交,因此它路由表示的意图而不是通用反馈旋钮,尽管在恢复剂量下路由的意图可以覆盖明确的请求。我们通过针对明显通货紧缩的控制来支持每个链接,并像确认一样简单地报告空值。