论文

TRACE:面向长程智能体安全的轨迹风险感知压缩

TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

模型评测上下文与知识上下文工程安全与风险评测

摘要

长程LLM智能体在长轨迹上产生安全证据,其中稀疏、延迟且组合式的风险信号常常逃过局部审核。现有的轮次级或短上下文检测器难以在扩展范围上可靠地保留并聚合这类证据。我们将长程智能体安全检测重构为轨迹级证据压缩问题,并提出面向长程智能体安全的轨迹风险感知压缩(TRACE)。TRACE采用压缩器-阅读器设计:压缩器在轨迹级监督下将完整轨迹编码为紧凑的潜在证据状态,阅读器以该潜在证据状态作为安全参照对原始轨迹作出判断。这一设计有助于聚合分散的风险线索并减少证据的过早丢失。在ASSEBench、Pre-Ex-Bench和R-Judge上,TRACE在所有受评主干上取得最佳准确率,较强基线最高提升12.6个百分点。在LongSafety上,TRACE随上下文长度增长表现出更小的性能退化。注意力可视化与案例研究表明,压缩参照有助于阅读器聚焦风险关键片段并恢复跨步骤证据。代码已在 https://github.com/Peregrine123/TRACE_official 开源。

TRACE:面向长程智能体安全的轨迹风险感知压缩:论文配图
图 1:长期智能体轨迹中的三种代表性风险类型,以及我们方法的动机草图。左侧面板显示多步骤工具误用、延迟攻击链和持久上下文操纵;右图概述了为什么需要在轨迹级别压缩和利用分散的、延迟的和组合的证据。