论文
AdaSR:具有分层相对策略优化的自适应流推理
AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization
摘要
大型推理模型通常遵循先读后思考的范式:它们观察完整的输入,在静态上下文中进行推理,然后得出答案。然而,许多现实世界的场景本质上是动态的,例如音频和视频流,其中信息作为连续流到达,模型必须在部分观察下推理、更新和响应。最近的流式推理方法允许模型在阅读时思考,但它们很大程度上依赖于对预先构建的轨迹的监督模仿,这限制了它们的灵活性。在本文中,我们提出了 AdaSR,一种自适应流推理框架,使模型能够在输入流期间进行推理,并在流完成后执行最终审议,学习何时思考以及在不同阶段分配多少计算量。为了优化这种分层推理过程,我们引入了分层相对策略优化(HRPO),它将策略优化分解为流推理和深度推理阶段,提供更细粒度的优势分配,而不是在所有词元上均匀分配单个序列级优势。 HRPO 集成了格式、准确性和自适应思维奖励,以强制执行有效的推理协议、保持最终任务性能并鼓励延迟感知计算分配。实验表明,与有监督的 微调 基线相比,AdaSR 在推理精度、计算效率和流延迟之间实现了更好的平衡。我们在 https://github.com/EIT-NLP/StreamingLLM/tree/main/AdaSR 发布了我们的代码。