论文

TISC:用于忠实重建的文本驱动图像语义通信系统

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

上下文与知识上下文工程

摘要

生成图像语义通信将图像转换为文本描述,然后通过基于扩散的生成模型在接收者处执行文本到图像的重建。这种范式由于其极低的带宽成本而引起了广泛的关注。然而,现有方法在发送端的图像到文本(I2T)语义提取和接收端的文本到图像(T2I)语义重建方面仍然面临两个关键瓶颈:(i)I2T中的语义丢失和失真,其中整体图像描述可能省略细粒度的对象属性和空间位置信息,导致生成的文本偏离原始图像语义; (ii) T2I 中语义不足的 忠实性,即使具有相同的语义忠实文本描述,不同的初始噪声设置也可能导致基于扩散的重建产生与原始图像具有不同程度的语义一致性的图像。这些问题共同限制了图像重建的语义忠实性。为了解决这些问题,我们提出了 TISC,这是一种专为忠实重建而定制的文本驱动的图像语义通信框架。 TISC包含两个关键设计:(1)树结构属性语义提取(TSASE),它将语义提取分解为全局场景、背景和对象级属性描述,涵盖每个检测到的对象的空间位置、形状/姿势、颜色、材质和其他物理属性; (2)初始噪声优化(INO)机制,根据联合考虑视觉和语义一致性的综合相似度得分在发射机处选择初始噪声种子。在多个数据集上的实验表明,TSASE 改进了对象位置恢复和语义描述 忠实性,而 INO 参数研究支持噪声选择所采用的配置。