论文

SpecHop:加速多跳检索代理的连续推测

SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents

模型推理投机采样

摘要

大语言模型 越来越多地使用网络搜索和文档检索等外部工具来解决信息密集型任务。然而,在复杂任务中使用多跳工具会带来大量延迟,因为模型必须反复等待工具观察才能继续。我们研究如何在不改变模型在没有加速的情况下所采取的最终轨迹的情况下加速这样的轨迹,假设可以使用更快但不太可靠的投机工具。我们开发了一个在多跳工具使用设置中进行无损推测的理论框架,描述了可实现的最佳延迟增益。我们提出了 SpecHop,一个持续推测框架,它维护多个推测线程,在目标工具输出到达时异步验证预测观察结果,提交正确的分支,并回滚错误的分支。这可以保持准确性,同时减少挂钟延迟。我们证明,SpecHop 可以通过足够的活动线程来接近预言机延迟增益。根据经验,在检索增强的多跳任务中,SpecHop 与理论预测非常匹配,并且在某些设置中将延迟减少了高达 40%。代码:https://github.com/mehrdadsaberi/spechop