论文

深度神经网络可以改善超大型科学数据的压缩吗?

Can Deep Neural Networks Improve Compression of Very Large Scientific Data?

模型评测模型能力评测

摘要

误差有限有损压缩是管理现代模拟和观测仪器产生的快速增长的科学数据量的基本技术。大多数最先进的压缩器都遵循预测残差范例,其中压缩有效性取决于预测器的质量:更准确的预测会生成更容易压缩的更小的残差。这一观察提出了一个问题:现代机器学习模型可以作为科学数据压缩的高级预测器吗?直接回答这个问题具有挑战性,因为开发特定于压缩的 ML 预测器需要大量资源。相反,我们利用气候领域,其中已经存在高精度的预训练天气预报基础模型,使它们成为理想的测试平台。我们提出了一个框架,将空间和时间深度学习模型集成到传统的误差有限压缩管道中。该框架支持自回归预测模型并避免误差积累。使用 ERA5 气候数据作为代表性的大规模科学数据集,我们在相同的量化和熵编码后端下针对最先进的压缩器 SZ3.1 评估了三个不同的 ML 预测器:基于 VAEformer 的编解码器 (CRA5)、图神经网络预测器 (GraphCast) 和视觉 Transformer 预测器 (Aurora)。我们对大约 1.7 TB 数据的评估揭示了一个令人惊讶的结果:尽管 ML 预测器可以生成更准确的预测,并且可以将重建质量提高高达 91%,同时为高度可预测的变量实现高达 9.6 倍的压缩比,但它们并没有提高整体数据集级压缩比。我们表明,仅预测精度是不够的:所得残差的空间结构在熵编码效率中起着决定性作用。