论文
AOSpec:低延迟代理服务的动作和观察共同推测
AOSpec: Action and Observation Co-Speculation for Low-Latency Agent Serving
摘要
大语言模型 代理越来越多地通过有状态工具进行操作,但模型生成和环境执行在每一步都保持序列化。随着解码速度的加快,工具执行成为一个日益严重的瓶颈。现有的仅采取行动或仅观察的推测使大部分延迟暴露出来:价值集中在一些缓慢的调用中,一些结果只能通过执行才能出现,而更长的前瞻通常需要越来越不可能的行动预测链。我们提出了 AOSpec,这是一个无损框架,可以在整个智能体-环境循环中共同推测动作和观察。期望值解码 (EVD) 将观察推测引导至具有最大预期延迟收益的结果,优化隐藏的预期时间而不是命中率。对于只有执行才能揭示的结果,AOSpec 在包含其效果的隔离分叉中启动延迟关键的目标操作,而联合操作状态验证 (JASV) 在重用之前根据已提交的执行验证操作及其原始状态。 JASV 将长范围动作依赖性从全链预测重铸为目标动作状态验证,打破了前瞻-准确性权衡,并在不牺牲串行语义的情况下解锁长范围重叠。在跨越四个Harness、五个参与者模型和五个服务速度的终端工作台服务设置中,AOSpec 优于每个实际基准,将平均端到端延迟减少了 11.8-32.5%,p99 延迟减少了高达 42.8%。它的增益随着解码加速而增加,并且其观察模型从 Terminal-Bench 转移到 SWE-bench Verified,无需重新训练。