论文
TrustMI:因果控制助理如何信任其用户
TrustMI: Causally controlling how assistants trust their users
摘要
大语言模型 (LLM) 助理通常会决定是否可以信任其能力、意图和诚信无法验证的用户和第三方。这种不确定性对于安全至关重要,因为信任错误的一方可能会导致智能体遵守有害请求或按照工具使用过程中遇到的恶意指令采取行动。为了研究这个问题,我们将信任定义为助理愿意接受另一方行为的脆弱性,并询问这种行为是否可以通过模型激活进行因果控制。我们构建了 2,000 个涵盖能力、仁慈和诚信的对比对话,其中配对响应完成相同的请求,但助理是否信任用户有所不同。从这些对中,我们学习转向矩阵,同时保持模型参数冻结,并在来自三个系列的六个指令调整模型中测试它们,发现转向在两个方向上单调地改变信任决策。然后,我们询问这种效应是否会扩展到多个与安全相关的智能体设置,包括有害请求、提示注入和内部威胁,同时使用良性任务和推理作为控制。我们的研究结果提供了证据,表明对用户的信任可以沿着模型激活中的线性方向进行因果控制,并提供了一种研究信任如何塑造语言模型中的安全相关行为的方法。
