论文
BFG:从图像位流直接理解细粒度语义
Image Bitstream Fine-grained Understanding for Privacy-Friendly AIoT
摘要
图像比特流细粒度理解(IBFU)旨在直接从编码图像字节序列执行细粒度分类和语义描述生成。与传统的像素域视觉理解不同,IBFU 无需将图像完全解码到像素域即可进行语义分析。由于在推理过程中不会显式重建像素级视觉内容,因此这种范例减少了处理管道内的视觉暴露,适合隐私友好的人工智能物联网 (AIoT) 应用。在本文中,我们提出了比特流细粒度生成器(BFG),这是一种专为 IBFU 量身定制的新型基础模型。 BFG 由两个主要组件组成:比特流语义编码器 (BSeE) 和细粒度语义生成器 (FSeG)。 BSeE 直接对编码图像比特流的语义表示进行建模,无需显式像素重建,而 FSeG 通过自回归生成将提取的比特流语义转换为详细的自然语言描述。为了在实际的 AIoT 场景中训练 BFG 并全面评估 IBFU,图像比特流在传输和存储过程中可能会受到损坏,我们构建了一个大规模的损坏比特流细粒度理解数据集(CFU-D),其中包含完整的比特流和跨多种损坏类型和严重程度的损坏变体。实验表明,BFG 在比特流损坏的情况下仍能保持稳定的细粒度字幕生成。例如,在Stanford Dogs Caption数据集上,平均CIDEr分数的性能仅从0.6339到0.6077略有变化,而Qwen-VL-Chat、BLIP-2、GLM、Gemini和GPT等视觉语言模型的性能却严重下降。本文为 AIoT 中隐私友好的细粒度理解提供了一个实用范例。
