论文
提取对话:基于 LLM 的 ASR 对话音频上下文的抽象压缩
Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
摘要
基于标准 LLM 的语音识别系统通常单独处理话语,限制了它们利用对话上下文的能力。在这项工作中,我们研究了先前轮次的多模态上下文是否改善了基于 LLM 的 ASR 以及如何有效地表示该上下文。我们发现,经过监督多轮训练后,会话上下文主要有助于上下文实体的识别。然而,对原始上下文的调节是昂贵的,因为前轮音频词元序列随着对话长度而快速增长。为了解决这个问题,我们提出了抽象压缩,它用固定数量的学习潜在标记替换先前回合的音频部分,同时显式保留相应的转录本。在域内和域外测试集上,压缩模型以更小的前轮音频足迹恢复了原始上下文调节的部分增益。我们还提供压缩设置及其权衡的有针对性的分析。