论文
使用不断演变的规则作为音频推理奖励的强化学习
Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning
摘要
音频推理对于机器理解声学世界至关重要。具有可验证奖励的强化学习可以引发这样的推理,但现有的奖励设计在其局限性方面是互补的:基于结果的奖励仅监督最终答案,让模型在不关注音频的情况下达到答案,而基于过程的奖励对推理本身进行评分,但依赖于粗略的、手工设计的和固定的标准,既不适应每个问题,也不立足于声学证据。此外,问题的要求也各不相同,有些取决于感知,有些则取决于多步骤推理,任何静态标准都会随着政策的改进而减弱。因此,用细粒度、基于音频的自适应奖励来监督推理过程至关重要,但也具有挑战性,因为为每个样本手工设计这样的奖励是不切实际的。为此,我们引入了 AudioRubrics,这是一个强化学习框架,它通过自我进化、基于音频的评分规则奖励来监督音频推理。 AudioRubrics 从原始波形中合成每个样本的规则,并以模型自身的生成轨迹为条件,重新生成并重新加权每组标准,提供持续学习信号,在静态标准饱和时不断针对当前策略的弱点。对三个音频推理基准的综合评估表明,AudioRubrics 的性能大大优于各种开源和基于训练的基准。此外,我们的分析表明,增益随 Rubric 生成器和判断的能力而变化,并且 AudioRubrics 收敛到稳定的推理长度,避免退化崩溃和无界增长。音频感知的改善进一步证明了声学证据中锚定监督的有效性。我们的项目页面位于 https://audiorubrics.github.io。