论文
超越提示:经Logit空间集成的语音LLM高效鲁棒上下文偏置(LOGIC)
Beyond Prompting: Efficient and Robust Contextual Biasing for Speech LLMs via Logit-Space Integration (LOGIC)
摘要
由文化变迁、潮流演化与个性化用户数据驱动的新实体快速涌现,给现有语音大语言模型(Speech LLM)带来重大挑战。这些模型虽然擅长一般会话任务,但其静态训练知识限制了对联系人姓名、播放列表或技术行话等领域特定术语的识别。现有方案主要依赖提示,可扩展性差:随着实体列表增长,提示遇到上下文窗口限制、推理延迟增加以及迷失在中间现象。另一替代方案——生成式错误纠正(GEC)——尝试通过后处理改写转写,但常出现过度纠正,引入从未被说出的实体幻觉。在本工作中,我们提出 LOGIC(Logit-Space Integration for Contextual Biasing),一个直接在解码层运作的高效鲁棒框架。与提示不同,LOGIC 把上下文注入与输入处理解耦,确保相对提示长度的常数时间复杂度。使用 Phi-4-MM 模型跨 11 个多语言语言环境的广泛实验表明,LOGIC 实现实体 WER 平均 9% 的相对下降,误报率仅增加 0.30%。