论文
超越及时遵守:审核语音生成中的属性级语音控制
Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation
摘要
自然语言描述已成为控制生成语音的灵活界面。现有的评估主要评估输出是否与提示匹配,但仅提示匹配并不能揭示预期变化之外的特征是否保持稳定。我们通过对三个语音生成系统(CosyVoice3、VoxCPM2 和 Fish-Speech-S2)的受控配对审核来检验这种区别。该评估包含 5,940 个输出,涵盖 6 个参考说话者、10 个文本、3 个随机种子和 11 个条件。使用声学、韵律、内容和说话人测量,我们发现预期目标方向的响应经常伴随着特定于描述符的信号级目标集之外的变化。这种模式在目标响应超过基线种子变化的输出中仍然存在,并且伴随的变化在不同系统中存在很大差异。我们进一步介绍了 VoDER-Cal,一种 无需训练 候选选择器,它保留足够强的目标响应,同时有利于较小的脱靶偏差。对于所有候选选择策略,三候选池将联合成功率从单样本直接生成下的 4.8% 提高到约 14%。在匹配的三候选预算内,VoDER-Cal 将保留的偏离目标偏差从仅目标选择下的 0.344 减少到 0.276,并提高了听众评级的保留。因此,保留敏感评估补充了即时依从性评估,而候选重新排名则提供了实际的推理时间改进。代码、配置文件和分析脚本可在 https://github.com/intelland/VoDER 获取