论文

Tokengeist:智能体对话中的多轮归因追踪

Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

模型评测模型行为与机制分析

摘要

当语言模型在多轮对话中产生响应时,先前轮次中的哪些 token 塑造了这一回答?这些依赖关系又是如何跨越先前轮次传播的?现有上下文归因方法一次性处理完整上下文,只能恢复表层依赖,而遗漏真实世界对话和多步推理任务的分层、非线性结构。我们提出多轮上下文归因(MTCA):给定模型响应中的一个目标片段,跨轮次向后追踪归因,不仅要识别哪些先前轮次直接相关,还要识别这些轮次自身如何依赖更早的上下文。我们提出 Tokengeist,一个与归因方法无关、可扩展的框架,它将归因转化为对会话轮次上有向无环图(DAG)的递归遍历,从而恢复完整的依赖路径。我们将发布 MTCABench,一个包含跨665个多轮对话的3845个目标片段的基准,标注了深度最高达14层、覆盖四种依赖类型的标准来源图。在四个开源权重模型上,扁平归因方法无法恢复多跳依赖,来源召回率不足20%,而 Tokengeist 达到90%。我们的结果揭示了单次归因的系统性失败模式——我们称之为来源坍缩——并推动了跨轮次递归推理的归因方法。

Tokengeist:智能体对话中的多轮归因追踪:论文配图
图 1:递归溯源示例。右侧箭头(紫色)显示 Tokengeist 的递归轨迹,在用户编写的回合处停止(T23、T3)。左侧箭头(灰色)显示平面归因轨迹。