论文
查询独立可变速率视觉词元编码
Query Independent Variable Rate Visual Token Coding
摘要
视觉语言模型的视觉词元压缩几乎完全是一个选择问题:决定保留哪些词元并丢弃其余的。最有效的标准根据语言模型对标记的关注程度对标记进行排名,这使得排名成为所提出问题的函数。这在单轮基准测试中是不可见的,而每当压缩表示被写入一次并读取多次时,就像当它在对话轮次中缓存或在设备和服务器之间传输时,这是决定性的。我们采用经典变换编码工具包的另一半:保留每个标记并改变其速率。转换代码公开每个词元的测量失真率曲线,并且通过这些曲线上的精确整数率失真优化在词元之间分配固定比特预算。没有文本进入管道,因此一种压缩表示可以满足任何查询。在相同的比特预算下,在两个数据集和两个容量上,它比均匀速率编码、封闭式注水和失真排序剪枝更好地保留了模型的输出分布及其答案。它与调整的问题修剪上的注意力排序修剪相匹配,并且一旦压缩图像必须回答有关同一图像的不同问题,它就会超越它。