论文

TRACES:通过轨迹状态建模对多轮 LLM 代理进行主动安全审核

TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling

智能体系统Agent 动作执行与治理

摘要

LLM 代理越来越多地通过多轮工具使用和环境交互进行操作,其中安全风险通常在最终结果中出现之前很久就从中间步骤中出现。因此,被动审计是不够的:事后诊断经常错过在风险发生时标记风险的机会。我们提出 TRACES,一种基于表示的主动审计师,它从观察者 LLM 的隐藏表示中学习前缀级轨迹风险状态。 TRACES 从步骤表示中引入潜在机制特征,并对它们的时间演化进行建模,以估计部分轨迹是否正在转向不安全行为。为了避免步骤级风险注释的成本和模糊性,TRACES 采用弱轨迹级监督进行训练,同时仍然产生密集的前缀级风险估计。在多个代理安全基准中,TRACES 改进了全轨迹安全预测和主动风险识别。我们的分析进一步表明,这些风险状态可以帮助训练更安全的智能体,突显主动审计对长期智能体安全的更广泛潜力。