论文
倾听而非照抄:内化基于音频证据的辅助上下文,增强全模态模型语音理解
Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding
摘要
全模态模型能较好转录干净的单人语音,但在说话人重叠和场景嘈杂时准确率急剧下降,此时尤其需要辨明谁说了什么。加入简短场景描述是一种直观改进,但本文显示,包含答案的文字会让模型照抄而不是倾听:分数上升,却未真正利用音频,静音测试即可暴露这一捷径。本文将其称为感知绕过,用基于音频证据的辅助上下文AGSC解决。AGSC包含三步:从音频构建引导倾听但不给答案的线索;通过答案重叠和静音测试检查线索泄漏及音频依赖;用线索辅助训练,测试时移除,获得不依赖线索的能力。在三个异构全模态模型上,AGSC训练把无辅助线索测试的截断平均排列词错误率mpWER从25%–71%降至9%–15%,数据为重叠且嘈杂的语音。对于流式控制,研究设计联合GDPO任务,分别归一化格式、门控和转录奖励,使模型学习何时使用线索及如何生成带说话人归属的转录。内化之后,AGSC几乎不增加推理开销。