论文

FSA-GRPO:教学听觉 LLM 使用少样本演示

FSA-GRPO: Teaching Auditory LLMs to Use Few-Shot Demonstrations

模型训练强化学习

摘要

少样本提示提供了一种有效的方法,使听觉 大语言模型 适应低资源任务,例如儿童语音识别。然而,大多数听觉 大语言模型 并未经过明确训练以这种演示条件格式进行推理,这限制了他们从情境学习 (ICL) 中受益的程度。为了解决这个限制,我们引入了少样本感知GRPO(FSA-GRPO),这是一种基于强化学习的后训练配方,它使用专门设计的奖励来鼓励模型利用少样本演示,从而增强其少样本适应能力。值得注意的是,仅使用 2k 个高资源成人 ASR 话语进行训练,提高了模型的总体小样本适应能力,不仅在儿童语音识别(无需任何域内训练的情况下相对 WER 减少 53.9%)方面取得了进展,而且在多语言 ASR(包括低资源语言)、语音翻译和音频理解方面也取得了进展。我们进一步研究数据选择以及辅助奖励的权重和相似度截止值,以确定有效的训练方案。我们的实验表明,当域内数据不可用或无法用于训练时,FSA-GRPO比直接调整相关域外数据更有效。