论文
更快推理模型的自我推测
Self-Speculation for Faster Reasoning Models
摘要
大语言模型 (LLM) 被部署用于涉及规划和多步骤决策的日益复杂的任务,但这些任务的高质量性能通常需要生成长推理跟踪。这不适合对延迟敏感的交互式应用程序,例如语音助手或 编码智能体,在这些应用程序中,生成延迟会严重影响用户体验。现有的加速方法通常侧重于 词元级 的生成,而不利用推理工作流程的结构。我们介绍 SSR:推理模型的自我推测,这是一种利用思想链 (CoT) 作为推测来源的 无需训练 自 推测解码 方法。 SSR 使用部分 CoT 答案分布作为起草者,使用完整 CoT 分布作为验证者,两者都以不同的推理预算源自同一模型。这是建立在以下观察基础上的:后来的部分 CoT 响应通常与全预算响应表现出更大的语义和词汇重叠。由于这种重叠,SSR 可以一次接受长草稿前缀,从而大大加快结构化和长格式生成任务的速度。为了进一步利用超出标准 推测解码 接受的连续前缀的草稿响应重叠,SSR 还集成了后缀解码,使用草稿播种后缀缓存并恢复超出接受前缀的有用范围,进一步减少草稿和最终响应之间词汇重叠较高的任务的延迟。我们在多个结构化和长格式生成任务上评估 SSR 最有用的情况,并证明 Qwen3.5 和 Gemma-4 等流行开源模型的总生成延迟相对提高了 24.1%。