论文

PairAlign:通过自对齐学习紧凑的自回归音频词元序列

PairAlign: A Framework for Autoregressive Tokenization via Self-Alignment with Applications to Audio Tokenization

应用与实践内容创作

摘要

现代学习系统用连续向量表示感知信号,但比较、检索、记忆、对齐和推理通常是象征性的。在语言中,词元提供了这个接口;对于语音和音频,必须学习。现有的音频分词器依赖于局部量化、聚类或重建,使得序列一致性、紧凑性、长度、终止和编辑几何图形只能间接控制。我们介绍 PairAlign,一个通过自回归自对齐进行紧凑音频标记化的框架。编码器将语音映射到连续条件,自回归解码器将词元从 BOS 发送到 EOS。给定两个保留内容的视图,PairAlign 会导出一个规范的锚目标,并训练两个视图来预测它,并将不相关的批内目标作为竞争序列。它首先从 VQ 目标学习自回归桥,然后过渡到具有锚点约束和防坍缩控制的 EMA 教师自对准。在 3 秒语音中,PairAlign 会生成更短的非退化序列,同时保持有序的配对视图一致性。在 TIMIT 检索存档上,它的运行速度为 8.28 个词元/秒,相对于第一阶段,存档词元计数减少了 70.65%,编辑距离工作代理减少了 91.87%。正负探针在音素不相交、三元组不相交和时间上重新排列的负数之间显示出很强的分离性,而速率控制的事后 BPE 无法恢复相同的紧凑性一致性操作点。这些结果揭示了速率与粒度的权衡:PairAlign 在每个局部指标上并没有一致地优于更密集的分词器,但提供了保留有序和关系结构的较低速率符号接口。从概念上讲,PairAlign 通过预测抽象目标而不是重建输入来遵循 JEPA 风格的预测学习;这里,目标是学习的可变长度符号序列。