论文

大语言模型的长程状态追踪:通过深层相互依赖工具调用序列执行MD5

Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls

模型评测模型能力评测

摘要

长视野任务在大语言模型(LLM)评估中仍然不常见,这是有原因的:当每一步都依赖于最后一步时,随着错误级联和端到端失败概率随着长度的增加而急剧增加,孤立地看起来很好的每步准确度会灾难性地下降。现有的代理基准报告了端到端的成功,但将这种状态跟踪困难与指令解释混为一谈,没有提供隔离它的对照组,并且容易受到诸如幻觉的最终答案之类的捷径的影响,因此他们无法说出为什么长期运行会失败。 LLM 是否可以在许多工具调用之间携带精确的中间状态本身尚不明确。我们通过让模型逐步计算加密哈希 MD5 来干净地测试这一点:一系列 196$ 相关工具调用超过 64$ 轮,同时它在自己的上下文中从一次调用到下一次调用携带四个 $32$ 位单词 $(a,b,c,d)$。解释是微不足道的,因为我们从头开始实现 MD5 (RFC~1321),所以我们将每个调用与真实跟踪对齐并检查摘要,因此任何失败都是纯粹的簿记。 gpt-oss-120b 是一个专家混合模型,每个令牌只有 $\sim$5.5B 活动参数,温度为 $0$,带有简短的固定提示,在所有 $196$ 调用中携带完整状态,并在大多数已完成的运行中返回正确的摘要。在最强大的设置中,我们用第二个 LLM 替换每个原始工具,因此驱动程序和工作人员从头开始计算整个哈希,循环中没有精确算术预言。有两个因素决定成功,但两者都不会改变权重:每轮都将模型自身的推理保留在其上下文中,并投票选出具有思考能力的工作人员以消除其模块化算术失误。我们通过起源来定位残余故障,将状态承载与算术和服务分开。

大语言模型的长程状态追踪:通过深层相互依赖工具调用序列执行MD5:论文配图
图1 运行的单一剂(带有确定性工具的驱动器)。驱动程序( gpt-oss-120b) 得到输入和七个原始工具,并发布调用本身: 准备_ message, 初始_ state, 然后获得_ step_ contats / compute_ f_ 和_ g/ mix_ step 重复 i= 0... 63i%0\ ldots 63, 携带 (a, b, c, d)( a, b, c, d) 在调用之间 。一个散列为190190+ 工具一次性调用(偶尔进行无害的重复查询),最后摘要与 Scratch MD5 引用匹配。