论文
LEAF:为语音感知种植无分支的树 大语言模型 后训练
LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training
摘要
用于语音感知 大语言模型 后训练 的最先进的 GRPO 式方法受到粗略贡献分配的影响,向响应中的每个词元广播相同的终端奖励优势。这忽略了转出批次中的有用结构,其中语音条件完成通常在重要决策发生分歧之前共享前缀。我们提出了自适应分叉低秩探索(LEAF),这是一种基于树的回顾性强化学习方法,无需在线分支或额外解码即可恢复此结构。 LEAF 对完整的响应进行采样,选择令人惊讶的边界,按共享前缀对响应进行分组,并使用后代奖励分配跨度优势。我们从理论上证明了 LEAF 的跨级贡献分配和边界选择设计。根据经验,在相同的轨迹采样和低秩适应预算下,LEAF 在语音问答和语音翻译基准方面比 GRPO 有所改进。值得注意的是,较小的 LEAF 训练模型始终优于当前最先进的全参数基线。