论文
解析数据流:面向长程智能体及其观察者的实时轨迹模型
Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers
摘要
长视野代理的跟踪超出了它的两个消费者:监视运行的人类观察者和代理本身,跟踪必须折叠回其有界上下文中。我们提出了一个实时跟踪模型,一个仅附加的事件分类帐,逐步折叠到类型化运行状态并编译成每个消费者的视图,并根据确定性的基本事实为两个消费者评估它。对于观察者方面,使用 LLM 阅读器作为代理进行评估,编译后的视图使用大约 14 倍和 15 倍的输入令牌(阅读器)来回答监控问题,并且成本比预算上限的单次调用读取原始跟踪的成本低 5-7 倍,并且具有更高的准确度(0.85-0.87 与 0.48)。因为问题是与视图模式共同设计的,所以我们将令牌和成本降低视为可转移的结果,以模式覆盖为条件。对于代理来说,在 120 链接顺序依赖任务上,在全上下文提示失败的情况下,将任务的运行统计信息维持在每步状态的机制会成功(干净协议下的 30/30 与 8/30,n=30,由于基准系统共同开发而标记为描述性);即时级暂存器以较低的成本匹配折叠的准确性,并且两臂分解将折叠的准确性归因于其确定性聚合,并将其成本优势归因于其紧凑性。与更便宜的替代品相比,折叠的剩余价值是确定性的可审计性并为来自同一状态的观察者提供服务。我们从观察到的故障中得出了跟踪折叠的 11 个候选要求,并用折叠不再提供帮助的顺序敏感的任务系列来界定它们。代码、基准测试、可重新生成的合成语料库以及所有工作台跟踪均已发布。
