论文

DREAM-R:基于强化学习精细化草稿、精确验证与完全并行执行的多模态推测推理

DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution

模型推理投机采样

摘要

推测推理近来被提出作为加速大型多模态模型中推理密集型生成的一种手段,但其效果常常受制于推测草稿与目标验证推理之间的不对齐。在本工作中,我们提出DREAM-R,一个显著提升推测推理性能的框架。其核心是推测对齐策略优化(SAPO),一个强化学习目标,训练草稿模型生成既忠实于目标轨迹又简洁的推理步骤。我们进一步提出基于阈值的验证机制(TBVM),采用基于比率的判据,仅在正证据明显占优时才对推测步骤给予稳定且可解释的接受,从而防止错误传播。在这些组件的基础上,我们开发了完全并行推测推理(FPSR)框架,在多步推理中将草稿生成、目标侧推理与验证并行化,支持提前停止与干净回退。在重推理基准上的实验表明,加速最高可达(up to),同时保持目标模型准确率,在不损害推理质量的前提下带来可观的效率增益。

DREAM-R:基于强化学习精细化草稿、精确验证与完全并行执行的多模态推测推理:论文配图
图 4:(a) 标准自回归推理和 (b) 完全并行推测推理 (FPSR) 的时间线比较。 FPSR 管道化起草(绿色)、验证(蓝色)和目标生成(红色)阶段,确保 GPU 永远不会闲置。与前瞻方法不同,我们允许“回滚”(c) 从验证失败中恢复,而无需重新计算。