论文

BTS-AgentBench:从只读遥测日志到代理基准的确定性、可重播管道

BTS-AgentBench: A Deterministic, Replayable Pipeline from Read-Only Telemetry Logs to Agent Benchmarks

智能体系统Agent任务评测

摘要

工业站点包含大量只读遥测数据,但很少有基准测试指定如何将这些记录编译为可执行的多轮代理任务。我们提出了一种实例化为 BTS-AgentBench 的遥测到情节构建方法。该管道将​​ BTS 元数据和原始历史规范化为只读工具存储,使用工具派生的标准答案和证据编译静态任务,并将保留的任务提升为类型化、有界的面向操作员的情节。 532 行版本增加了澄清、目标修订、时间戳策略、质量门控报告和证据归属,同时保留源计算和拆分。编码合同预检报告零结果,构造排除控制器完成 0/532 行。两个独立的原始到剧集构建与所有 11 个逻辑工具存储导出相匹配,并准确再现已发布的 356/87/89 训练/开发/测试工件。将共享构建路径应用于 XAI4HEAT 产生 204 集;在其 41 行保留测试拆分中,控制器完成 0 行,保留的 GPT-5.5 执行完成所有 41 行。代码、工件和重播报告可在 https://github.com/kjy7567/BTS-AgentBench 上获取。