论文

重新思考基于长度的训练:语音标记语言模型中的批量组合和损失归一化

Rethinking Length-Based Training: Batch Composition and Loss Normalization in Speech Token Language Models

模型评测模型行为与机制分析

摘要

从短到长的训练是语音模型的简单课程,但其收益可能难以解释。在语音标记语言模型中,基于长度的训练可以改变批次平均损失下的洗牌策略、批次组成、标记保留和标记权重。我们通过匹配比较来理清这些因素。在测试的设置中,当批次组成和词元暴露固定时,从短到长的排序没有显示出独立的好处。第一纪元分组降低了 Mimi 在批量平均损失下的困惑度,但在词元平衡损失下没有观察到这种增益。交叉标记器结果与块长度变化和标记权重之间的联系一致。这项工作为研究可变长度语音模型中基于长度的训练提供了系统的分析协议。