论文

将感知与描述解耦:多元时间序列和语言之间基于计算的表示对齐

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

模型训练合成数据

摘要

训练多模态模型以使时间序列与语言保持一致会陷入自我监督陷阱。通常的方法要求 LLM 阅读一系列内容并编写描述,因此标签质量受到模型应该学习的感知技能的限制。数据所教的内容永远不会超过贴标者已经知道的内容。第二个差距使情况变得更糟:大多数数据集使用单个变量,但重要的模式(跨通道相关性、超前滞后结构、同时出现的异常)仅出现在多个变量中,而标签 LLM 的限制最暴露。这两个问题造成了一个三难困境:现有的方法是可靠的、现实的或可扩展的,但没有一个方法能够同时实现这三个目标。我们通过将感知与描述脱钩来解决这个问题。确定性代码根据真实的开源多元序列计算一组统计数据; LLM 用语言表达了这些预先计算的事实。 LLM 表现不佳的感知是通过计算来处理的,而 LLM 则处理表达。这产生了 CGTime,我们的基于 4B 参数计算的时间序列语言模型。 CGTime 在多变量理解任务上的表现优于更大的通用模型:它在我们的基准测试中获得了最佳的多变量事实得分(GPT-4o-mini 为 0.283,GPT-4o-mini 为 0.173,GPT-5.4-nano 为 0.203),这一差距在针对每个基线的 Holm 校正配对显着性测试中仍然存在。它还更准确地在生成的描述中陈述可验证的数字事实,并涵盖更广泛的统计属性。