论文

Transect:保留长任务 Agent 评测的可观测性

Transect: Retaining Observability for Long-Horizon LLM Agent Evaluations

智能体系统Agent任务评测长程任务评测

摘要

Frontier AI 评估越来越多地使用开放式 Agentic 长视野任务,其记录可以跨越复杂的多智能体网络的数百页输出和操作。因此,可观察性范围(评估者可以可靠地推断出智能体行为的范围)正在缩小。语言模型助手可以帮助对智能体行为进行分类和解释,但也为人类评估者提供了很大的分析自由度,从而威胁到基于语言模型的转录分析的可重复性和可审核性。 Transect 是一个基于 Inspect Scout 构建的开源包,可帮助评估人员了解长时间的智能体运行是如何展开的,识别值得调查的行为,并根据记录检查解释。用户在可重复使用的评估系列配置中指定任务上下文和行为词汇,并单独提供判断模型和分析设置。 Transect 的可导航报告将记录的事件、token 使用、子智能体活动以及模型生成的行为标签排列在通用的回合制时间轴上。审阅者可以快速掌握运行的叙述,跟踪任何标签或事件的源头,并导出基础数据表以进行交叉运行分析。我们演示了人工智能研发评估的工作流程,生成了近 1300 万个 token,将智能体的工作划分为与研究技能分类、子智能体授权和交互以及 token 使用相一致的行为阶段。综合观点显示,重点是业务工作和手稿制作,几乎没有证据表明持续的假设生成阶段——可以说是高质量科学产出的必要组成部分。 Transect 灵活、可定制的转录分析管道将使评估人员能够跟上更长、更复杂、更频繁的人工智能评估,同时支持科学严谨性、透明度和可重复性。

Transect:保留长任务 Agent 评测的可观测性:论文原图
图 2:协调器转动轴上的 TabPFN 纪元:特定于论文的活动、研究活动、累积参考文献、子智能体部署、操作员消息和上下文窗口大小。灰色条显示每轮五个评委卷中的成对标签不一致;颜色越深意味着分歧越大。