论文
当遗忘看似改善:流式说话人适配中的指标掩盖
When Forgetting Looks Like Improvement: Metric Masking in Streaming Diarizer Adaptation and the Price of Rehearsal
摘要
小数据适配可以改善语音检测,却损害说话人归属判定。我们研究一个已发布的流式说话人分离系统:用7.5小时双人对话进行适配,并在六个语料库上评测。适配显著提高分布内说话人分离表现,并迁移到一个独立语料库。但不同评测场景下的改善并不一致,因为新增混淆主要与时间维度的身份一致性受损有关,而非说话人数目判断错误。局部重映射诊断揭示,各语料库的身份退化模式不同,说明适配可能改变流式模型随时间维持说话人分配的方式。旧数据回放减少了已观察到的退化,却降低跨域迁移表现。结果说明,在适配流式说话人分离系统时,需要联合评测检测准确率、身份一致性和原有能力保留。