论文
相同的有效负载,不同的渠道:测量工具使用语言模型中的信任不对称性
Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
摘要
随着语言模型扮演调用 API、读取工具输出以及作用于第三方内容的代理角色,它们的攻击面超出了用户键入的范围。尚未系统地研究过它们是否以相同的方式处理恶意指令,无论其到达何处。我们引入了安全不对称评分(SAS),使用匹配的有效负载对来衡量模型对对抗性内容的敏感性如何根据其是否到达用户消息、工具元数据或工具输出而变化,这些有效负载对保持恶意文本相同且仅改变通道。在 10 个生产 LLM 和三个攻击系列中,相对于用户消息中的相同指令,通用模型对作为工具元数据到达的指令大幅折扣,而代理本机模型对它们的折扣要低得多。这种差异在可供性匹配的控制均衡工具可用性和评分以及大小控制的混合效应分析中仍然存在。在工具表面内,模式相反:相同的内容在工具的描述中比在其输出中更像指令,并且功能可供性相同。模型将工具元数据视为指令,将工具结果视为数据。在 Llama 3.3-70B 和 GPT-OSS-120B 中,该信号因果性地存在于中后期深度,但采用非线性编码,因此线性探针会错过激活补丁恢复的内容。