论文

为语言模型智能体保证组织轨迹证据:片段、方法和残差

Organising Trajectory Evidence for Language-Model Agent Assurance: Fragments, Methods, and the Residual

智能体系统Agent任务评测

摘要

评估语言模型智能体的方法包括日志规则检查器、技能覆盖范围和构成分析、支持检查器、前缀监视器、执行门和罕见事件估计器。每个人都观察跑步的不同部分,并提出不同的强度主张,并且没有共同的解释说明这些主张如何结合或他们未检查的内容。我们给出一个由逻辑、信息片段和保证分类账构建而成的。要求是两层逻辑的公式:记录事件上的外部有限跟踪时间逻辑,以及智能体的记录上下文在决策时支持的参数结构的内部逻辑。因此,违反规则和对撤回支持采取的行动是一种语言的公式。评估器、智能体和执行门可用的信息定义了该语言的片段;每个检查方法决定一个片段并返回一个类型化的声明:精确的、在指定的测试套件上、风险界限或描述性的。账本合并了证据,并将每项义务分类为已确定、已解决但未确定或未解决。在 456 个发布的 $τ^2$ 基准电信轨迹上,基准预言机标记了 231 个运行;添加规则检查器、支持替身和前缀监视器基线将联合提高到 391、401 和 407,每个贡献标记其他未命中的标记,并且一个门可以在门控部署上精确执行一项禁止。 49 次未标记的运行以及未履行或未解决的义务构成剩余。发现使未知的需求变得明确,然后新的或更强大的检查器会减少它。