论文
ParaBridge:桥接语音语言模型中的副语言感知和对话行为
ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models
摘要
语音比文字携带更多的信息:孩子的声音、恐惧的语气或嘈杂的背景都应该让足够有能力的口语对话助手做出不同的答复。当前的语音语言模型(SLM)可以识别此类副语言线索,但在开放式对话中经常忽略它们。我们观察到,推理阶段的简单副语言指令支架缩小了这种感知-行为差距,表明相关线索已经潜伏在模型中。然而,这种支架在多回合环境和竞争指令下仍然很脆弱。因此,我们提出 \textbf{ParaBridge},一种 同策略 自蒸馏 方法,将脆弱的推理时间支架转变为稳定的模型行为。在训练期间,脚手架仅作为临时特权视图;无支架模型生成自己的响应,而支架视图则沿着其轨迹提供密集的、完整词汇的下一个标记目标。这种监督可以指导非词汇线索何时影响回复,而无需精心策划的对话、人工标签或外部奖励模型。在 Qwen3-Omni-thinking 上,ParaBridge 将无脚手架的 VoxSafeBench SAR 从 $14.6\%$ 提高到 $40.3\%$,并将 EchoMind 平均评级从 $3.27$ 提高到 $3.92$。它还保留了一般能力,MMAU-Pro、VoiceBench 和 GPQA 都在原始模型的 0.4分以内。除了训练分布之外,ParaBridge 还推广到看不见的副语言线索,从以安全为导向的训练转变为以同理心为导向的对话,并在不同的 SLM 主干上工作。