大语言模型的长程状态追踪:通过深层相互依赖工具调用序列执行MD5
Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
摘要
长视野任务在大语言模型(LLM)评估中仍然不常见,这是有原因的:当每一步都依赖于最后一步时,随着错误级联和端到端失败概率随着长度的增加而急剧增加,孤立地看起来很好的每步准确度会灾难性地下降。现有的代理基准报告了端到端的成功,但将这种状态跟踪困难与指令解释混为一谈,没有提供隔离它的对照组,并且容易受到诸如幻觉的最终答案之类的捷径的影响,因此他们无法说出为什么长期运行会失败。 LLM 是否可以在许多工具调用之间携带精确的中间状态本身尚不明确。我们通过让模型逐步计算加密哈希 MD5 来干净地测试这一点:一系列 196$ 相关工具调用超过 64$ 轮,同时它在自己的上下文中从一次调用到下一次调用携带四个 $32$ 位单词 $(a,b,c,d)$。解释是微不足道的,因为我们从头开始实现 MD5 (RFC~1321),所以我们将每个调用与真实跟踪对齐并检查摘要,因此任何失败都是纯粹的簿记。 gpt-oss-120b 是一个专家混合模型,每个令牌只有 $\sim$5.5B 活动参数,温度为 $0$,带有简短的固定提示,在所有 $196$ 调用中携带完整状态,并在大多数已完成的运行中返回正确的摘要。在最强大的设置中,我们用第二个 LLM 替换每个原始工具,因此驱动程序和工作人员从头开始计算整个哈希,循环中没有精确算术预言。有两个因素决定成功,但两者都不会改变权重:每轮都将模型自身的推理保留在其上下文中,并投票选出具有思考能力的工作人员以消除其模块化算术失误。我们通过起源来定位残余故障,将状态承载与算术和服务分开。
