论文

超越可疑步骤:长时程智能体的本体信任

Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents

智能体系统Agent 动作执行与治理

摘要

长时程智能体日益在众多步骤、工具与观察中运行。在此场景下,相关的监督问题不仅是每个动作是否局部有效,还有不断演化的轨迹是否仍对应用户授权的任务。漂移可能悄然累积:智能体可能在每一步都以貌似合理的参数调用正确的工具,而其轨迹前缀却滑向更宽泛的角色、相邻的目标或用户从未提供的证据。现有监视器大多检查局部合规、对最终轨迹给出判定或对通用风险打分;它们并不直接估计这种前缀级关系。我们引入本体信任——一种轨迹前缀的任务条件化属性,并将其实现为 RGE,一个把信任沿角色(Role)、目标(Goal)与证据(Evidence)分解的在线监视器。RGE 仅用 LLM 导出结构化的任务与步骤表示;信任状态更新、投影与干预决策都是确定性的,因此输出是一条可回放、可审计的信任轨迹,而非单一的端到端裁判判定。我们从 OSWorld、FinanceBench 与 EICU-AC 构建跨域轨迹语料,覆盖良性执行、前缀配对漂移与伪一致失败。在该语料上,RGE 在前缀配对漂移检测上优于改造后的规则、裁判与盾式基线。在两个较大的估计器模型上,它在每个基准上的漂移 F1 均超过 93%,同时保持良性覆盖率不低于 95.8%。伪一致更难:其检测取决于任务完成是否外部可见,我们以经验方式刻画了这一结构性限制。

超越可疑步骤:长时程智能体的本体信任:论文配图
图1:Living-off-the-Land 轨迹上的快照级 AUC 热图。