论文

通过来源分析保护 LLM 代理免于错位

Safeguarding LLM Agents from Misalignment through Provenance Analysis

智能体系统Agent 动作执行与治理

摘要

随着 LLM 代理越来越多地使用强大的工具,确保他们的操作符合用户的意图变得至关重要。当特工提议的行动偏离该意图时(这种现象称为偏差),可能会造成难以挽回的伤害。现有的运行时护栏依赖于 LLM 作为判断范例,该范例缺乏用于推理对齐的系统框架,通常会产生不一致或难以审核的判断。在来源分析的推动下,我们提出了一个概念框架,将偏差检测形式化为确定所提议的工具调用是否得到代理上下文中可追踪证据的支持。基于这个框架,我们构建了 ProvenanceGuard,这是一个多级管道,可以在执行之前分析代理的操作是否存在三种类型的不一致,并且只允许对齐的操作。我们在 AgentSafetyBench 和 WorkBench 上评估了 11 个主干网 LLM 的 ProvenanceGuard。与 LLM-as-a-judge 基线相比,ProvenanceGuard 将 Agent-SafetyBench 上未对齐迹线的错误率从 44.3% 降低到 2.1%,将 WorkBench 上的错误率从 32.4% 降低到 18.7%,同时将任务成功迹线的干预从 31.2% 减少到 13.0%,并且对对齐迹线的不必要干预没有出现统计上显着的增加。这些结果表明,结构化、基于来源的推理为保护 LLM 智能体免遭错位提供了有效且实用的基础。