论文

DuplexJev:不解码的批量语音决策

Batched Speech Decisions Without Decoding: Single-Token Supervision Lets a Frozen LLM Hear Beyond the Transcript

应用与实践语音交互与综合语音服务

摘要

全双工语音智能体要做许多小的封闭决策,现有系统靠慢的自回归解码回答。我们提出DuplexJev:把ASR编码器隐状态经小连接器送入冻结LLM,把每个问题读取为其选项上的单token分布。全程不解码,8 GPU节点约0.1秒即可回答关于八条话语的80个决策。使用末层连接器时,口语QA接近读转写(90%对91%)。DuplexJev还能听见说话人:用交叉注意力连接器,性别与情绪准确率都达90%(原为55%与28%),口语QA仅降1点(83%到82%)。我们用读出答案token上的交叉熵训练决策,而非常规的转写蒸馏(其教师听不到声音),转写蒸馏仅用于内容。编码器与LLM可互换;我们发布权重、训练配方、面向全双工服务的批量推理管道与一套双语口语QA集。