论文

多代理 LLM 跟踪的基于知识的零重放调试

Knowledge-Based Zero-Replay Debugging of Multi-Agent LLM Traces

AI 基础设施可观测性

摘要

多代理 大语言模型 (LLM) 系统的可靠运行取决于调试长执行跟踪,其中少数具有因果关系的决定性事件隐藏在消息、路由、内存写入和工具调用的非结构化日志中。标准工具是反事实重放(倒带、编辑和重新运行轨迹以测量每个事件的效果),但其成本随着候选事件的数量线性增长,使得详尽的重放在规模上不可行。我们将跟踪调试视为基于知识的决策支持问题。每个跟踪都被编译成一个关于路由、内存、工具使用、不确定性和潜在证据的结构化事件知识图,并且经过校准的预测器决定应该将稀缺的重播预算花在哪里。我们不提议新的重放预言机;我们提出了一种无需支付重放成本即可预测其结果的方法。我们制定了零重播反事实效果预测:在固定预算下给定一条轨迹,在执行任何重播之前预测预言机将标记哪些事件为高效果。 BranchPoint-Latent 是知识图谱可观察、结构、不确定性和潜在特征的轻量级预测器。针对 37 个跟踪系列的确定性重放预言机进行校准,单个学习排名梯度提升预测器以零预言机重播成本将保留系列的每跟踪定位 (Branch Recall@5) 从 0.73 提高到 0.93。我们并没有声称拥有普遍的主导地位,而是描述了何时廉价的图中心性就足够了以及何时需要学习的证据。其结果是一个用于人工智能可靠性调试的可审计、经济高效的决策支持系统,明确定位在具有可重现工件的成本准确性前沿。