论文

推理图:通过以证据为中心的思想链反馈确定代理的准确性

Reasoning Graphs: Deterministic Agent Accuracy through Evidence-Centric Chain-of-Thought Feedback

上下文与知识上下文工程记忆Agent记忆

摘要

语言模型代理从头开始对每个查询进行推理:每次代理检索证据并进行深思熟虑时,思维链都会被丢弃,下一个类似的查询将在没有事先洞察的情况下开始。这会产生较低的准确性和较高的方差,因为同一类型的查询可能会成功或失败,无法预测。我们引入推理图,这是一种图结构,它将代理的每个证据思维链保留为连接到他们评估的证据项的结构化边缘。先前的记忆机制将提炼的策略存储为通过查询相似性索引或根据新近度附加的平面记录,而推理图可以实现以证据为中心的反馈:给定一个新的候选集,系统会遍历所有先前运行中每个证据项的所有传入评估边,显示之前如何判断该特定项。这种从证据向内的向后遍历在结构上是与查询相似性检索不同的功能,因为反馈与代理当前正在检查的特定证据相关,而不是与查询相关。我们进一步引入检索图,这是一种补充结构,可以为管道规划器提供信息,以在连续运行中收紧候选漏斗。两个图一起形成了一个自我改进的反馈循环:在连续运行中,准确度上升,方差下降,每个决策都可以通过图表完全追踪。这种改进不需要重新培训;基本模型保持冻结状态,所有收益都来自通过图遍历进行的上下文工程。我们形式化了图结构、遍历算法和反馈机制,并描述了一个顺序集群评估协议,用于测量多跳问答基准上的准确性收敛和方差崩溃。