论文

Agent-ToM:学习通过心理理论推理监控自主 LLM 代理

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

智能体系统Agent 动作执行与治理

摘要

由于延迟、上下文相关和长范围的攻击模式,监控自主 大语言模型 (LLM) 代理的隐蔽恶意行为具有挑战性。代理可能会追求隐藏的目标,同时保持表面上的良性行为,即使具有完整的轨迹访问,也使得检测变得困难。先前的监测方法改进了脚手架或集成聚合,但独立处理每个轨迹并且不从先前的监测经验中学习。此外,标准推理方法解释观察到的行为,而无需明确推理区分良性任务执行和隐蔽偏差所需的代理信念、意图和目标一致性。我们提出 \textbf{Agent-ToM},这是一种基于心智理论 (ToM) 推理的学习监控框架,用于自主代理的安全分析。 Agent-ToM 通过推断信念、具有校准置信度的意图假设、预期行动以及与任务一致的行为基线的偏差来执行结构化全轨迹分析。在推理时,它采用 \textit{Reason-Verify-Refine} 管道来构建和验证监控决策。在训练时,Agent-ToM 将批评信号提取到持久的 \textit{语义护栏记忆} 中,从而实现跨情节可重用的信念和意图条件约束。我们在对抗代理监控基准(SHADE-Arena 和 CUA-SHADE-Arena)上评估 Agent-ToM。 Agent-ToM 实现了强大的精确回忆平衡,并优于最先进的监控基线,包括集成方法,同时使用连贯的两次调用推理管道。这些结果表明,监控层的学习与结构化 ToM 推理和验证相结合,为保护自主 LLM 代理提供了有效且可部署的基础。