论文
TomasuLLM:LLM Agent的无序推测执行
TomasuLLM: Out-of-Order Speculative Execution for LLM Agents
摘要
长时间运行的工具可能会主导编码Agent延迟:编译器、测试套件和存储库命令在Agent空闲时需要几秒到几分钟的时间。这种观察停滞带来了与驱动无序处理器相同的压力——顺序接口隐藏了可以预测和提前开始的工作,但只有在它和每个早期步骤都经过验证之后,推测结果才可能变得可见。我们提出了 TomasuLLM,一个运行时,它可以不按轨迹顺序执行Agent工具调用,同时保持任务执行的正确性。它起草未来的操作,在隔离的写时复制沙箱中运行它们,跟踪它们的依赖关系和效果,并仅在针对提交状态进行验证后按轨迹顺序提交结果。在跨越亚秒级到分钟长的工具调用的三个基准测试中,TomasuLLM 改进了报告的基准测试方法,并根据工具延迟进行扩展:100 个 SWE-bench 验证任务为 1.31 倍,28 个 Terminal-Bench 2.0 任务为 1.35 倍,18 个 SWE-Marathon 会话为 1.27 倍匹配进度。在 4,010 条经过审核的提交验证记录中,它产生了零错误接受。