论文

TrustMI:因果控制助理如何信任其用户

TrustMI: Causally controlling how assistants trust their users

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 助理通常会决定是否可以信任其能力、意图和诚信无法验证的用户和第三方。这种不确定性对于安全至关重要,因为信任错误的一方可能会导致智能体遵守有害请求或按照工具使用过程中遇到的恶意指令采取行动。为了研究这个问题,我们将信任定义为助理愿意接受另一方行为的脆弱性,并询问这种行为是否可以通过模型激活进行因果控制。我们构建了 2,000 个涵盖能力、仁慈和诚信的对比对话,其中配对响应完成相同的请求,但助理是否信任用户有所不同。从这些对中,我们学习转向矩阵,同时保持模型参数冻结,并在来自三个系列的六个指令调整模型中测试它们,发现转向在两个方向上单调地改变信任决策。然后,我们询问这种效应是否会扩展到多个与安全相关的智能体设置,包括有害请求、提示注入和内部威胁,同时使用良性任务和推理作为控制。我们的研究结果提供了证据,表明对用户的信任可以沿着模型激活中的线性方向进行因果控制,并提供了一种研究信任如何塑造语言模型中的安全相关行为的方法。

TrustMI:因果控制助理如何信任其用户的原论文方法或结果图
图 1:引导信任调节对间接提示注入的敏感性。在信任引导 ($h_{\ell}\leftarrow h_{\ell}+\alpha~\cdot~v_{\ell}$) 下,QWEN3.5-27B 评估包含注入的工具输出,以将资金发送到未经授权的帐户。降低信任($\alpha=-2$)使智能体能够识别威胁,拒绝未经授权的传输,并完成用户的原始请求。相反,增加信任($\alpha=+2$)会导致对恶意负载的合规性。