论文
GALA:用于文本到时间序列合成的世代感知跨模态对齐
GALA: Generation-Aware Cross-Modal Alignment for Text-to-Time-Series Synthesis
摘要
从自然语言合成时间序列正在成为可控时间序列生成的最具表现力的形式。然而,现有的文本条件生成器要么采用从现成的文本编码器冻结的标题嵌入,要么端到端地调整编码器,让去噪损失仅作为副产品塑造嵌入。在任何一种情况下,条件表示都不会故意与信号模态匹配,从而使其不适合指导生成。我们通过引入 GALA 来解决这个问题:用于文本条件时间序列生成的生成感知跨模式对齐。 GALA 是一种两阶段方法,首先将预训练的文本编码器与时间序列基础模型对比耦合到共享嵌入空间中,两个编码器都适合通过辅助生成损失进行生成,然后冻结生成的标题嵌入以驱动流匹配生成器。在跨越四个域和三个片段长度的 TSFragment-600K 上,GALA 设定了新的技术水平,在 36 个度量列中的 30 个中排名第一,在长度 24/48/96 时达到平均排名 1.08/1.08/1.42,而最强基线为 1.92/2.00/1.75。我们进一步发现,生成器内部的文本编码器强制在保真度和标题遵循性之间进行权衡,而对齐嵌入的条件则打破了这一点:FID、CTTP 和 JFTSD 都立即得到改善。消除辅助损失会同时降低 FID、CTTP 和 JFTSD,这表明生成项是对齐的必要组成部分而不是附加项。