论文
从意识到遵守:通过上下文感知解码弥合口语对话系统中的上下文差距
From Awareness to Adherence: Bridging the Context Gap in Spoken Dialogue Systems via Context-Aware Decoding
摘要
尽管端到端(E2E)语音对话系统取得了成功,但在多轮对话中保持严格的上下文一致性仍然是一个挑战。虽然之前的工作将这些失败归因于模型忘记对话历史,但我们强调了一个同样重要但被忽视的瓶颈:潜在上下文意识和主动遵守之间的差距。尽管模型在内部识别相关的过去话语,但强大的参数先验通常会在解码过程中掩盖这些信号。为了弥补这一差距,我们提出了一种音频适应的上下文感知解码(CAD)方法。通过利用内部注意力机制来隔离关键的历史轮次,我们的方法在推理过程中对比有和没有此关键上下文的输出分布,直接放大多模态上下文信号。对 Audio MultiChallenge 基准的评估表明,语义记忆和自我连贯性子任务有显着改进,成功地执行了严格的、忠实于上下文的遵守。