论文
带对齐反馈的多功能牵伸机 推测解码
Multi-Drafter Speculative Decoding with Alignment Feedback
摘要
推测解码 (SD) 通过使用较小的模型来起草未来的词元,然后由目标 LLM 进行验证,从而加速 大语言模型 (LLM) 推理。这通过仅接受对齐的词元来保持生成质量。然而,通常针对特定任务或领域接受过培训的个人绘图员在不同的应用程序中表现出的有效性有限。为了解决这个问题,我们引入了 \textsc{MetaSD},这是一个将多个起草者集成到 SD 流程中的统一框架。 MetaSD 通过利用对齐反馈和将绘图员选择视为多臂老虎机问题,动态地将计算资源分配给异构绘图员。大量实验表明,MetaSD 的性能始终优于单起草者方法。