论文
BSD:读取并干预模型对用户的隐含判断
User Model Extraction via Belief Self-Distillation
摘要
大型语言模型(LLM)隐式推断用户的属性并相应地调整他们的行为,但这些信念仍然难以检查和因果操作。我们引入了信念自蒸馏(BSD),这是一个统一的读写框架,通过学习可以解码和写回模型的紧凑用户表示来桥接线性和因果探测。冻结的大语言模型充当自己的老师,从自然对话中提炼信念,无需外部注释。与传统的探测不同,BSD 不仅隔离激活中存在的信息,还隔离其因果作用可以直接测试的状态。在多个模型系列中,BSD 忠实地恢复了用户信念,并实现了比匹配的隐藏状态引导更强的干预。至关重要的是,我们发现拒绝不仅取决于请求,还取决于模型推断的用户意图:改变这种信念会改变拒绝,同时保持请求不变。我们进一步发现了一个惊人的跨模型规律:独立训练的大语言模型汇聚在一个共享的几何图形上来代表他们的用户。总之,这些结果揭示了隐式用户模型作为可读和因果可写的内部状态,对人工智能安全具有直接影响,塑造了模型如何根据他们认为正在与之交互的人来制定安全决策。
