论文

DeSRPA:通过推理时间干预解耦语音角色扮演代理

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

模型推理解码与生成控制

摘要

虽然 大语言模型 (LLM) 彻底改变了基于文本的角色扮演,但创建沉浸式语音角色扮演代理 (SRPA) 需要在认知推理和副语言细微差别之间建立无缝桥梁。当前的 SRPA 主要依赖于端到端 (E2E) 微调。然而,由于该范式依赖于特定于角色的数据,因此对未见过的字符的泛化能力较差,同时还施加了“模态对齐税”,从而降低了内在的 LLM 推理能力。我们提出了 DeSRPA,这是一种通过对冻结主干进行推理时间干预来进行角色扮演的代理框架。 DeSRPA采用双层控制向量机制,内部认知引导和外部表达渲染,来同步“思想”和“声音”。 SpeechRole 和 OmniCharacter 基准测试表明,DeSRPA 在个性和情感一致性方面显着优于 E2E 基准。它实现了高度的语音自然度,缩小了与 GPT-4o Audio 等专有模型的差距,同时保持了可扩展性和 无需训练 范例。