论文

审计LLM智能体动作选择中的出处敏感性

Auditing Provenance Sensitivity in LLM Agent Action Selection

模型评测安全与风险评测

摘要

LLM智能体从混合了用户请求、工具输出、检索记录、记忆与不可信文本的上下文中选择工具与参数。证据可以相关而不被授权决定一个决策——因此正确的动作不必只落地在被许可的证据上。我们引入目标专属的授权审计:为每个工具与参数目标分别标注上下文因子。其主检验在保持任务、命题、位置与策略不变的同时,只改变命题的来源权威性。随后检验有效证据被削弱时的行为,并以上下文子集交互作为次级定位诊断。跨450个受控的下一动作任务与多个开放权重LLM家族:受信任与不受信变体在竞争案例中产生不同动作的比率为5.4%,对照支持案例为1.7%。在受控退化下,未经授权的竞争以“全对—混合错误—干净对”模式保留在2.4%的比较中(95% CI 2.1–3.0%)。这些是受控压力集比率,而非部署普及率。模型响应文本性的来源权威线索,但这不能阻止不受信证据影响其行动。

审计LLM智能体动作选择中的出处敏感性:论文配图
图 1:对正在运行的电子邮件示例进行特定于目标的授权审核的示意图。