论文

表征几何塑造 CT 肠造影视觉语言建模中的任务表现

Representation geometry shapes task performance in vision-language modeling for CT enterography

模型评测模型能力评测

摘要

计算机断层扫描 (CT) 小肠造影是评估炎症性肠病 (IBD) 的主要成像方式,但最能支持该方式自动分析的代表性选择尚不清楚。我们提出了第一项关于腹部 CT 小肠造影视觉语言迁移学习的研究,并确定了两个主要发现。首先,切片嵌入的平均池化提供了更好的分类疾病评估(59.2% 三级准确度),而注意力池化提供了更好的跨模态检索(0.235 文本到图像 MRR)。这种模式适用于所有测试的 LoRA 配置,表明两个聚合器强调学习表示的不同属性。其次,每切片组织对比度比更广泛的空间覆盖范围更重要:多窗口 RGB 编码(将互补的亨斯菲尔德单位窗口映射到 RGB 通道)优于通过多平面采样增加空间覆盖范围的所有策略,并且在这种设置中添加冠状和矢状视图会降低分类性能。对于报告生成,没有检索上下文的 微调 在流行率匹配的机会水平上产生 1 以内的严重性准确度(70.4\% vs.\ 71\% 随机),这表明除了类别分布之外几乎没有学习到排序。检索增强生成 (RAG) 在所有配置中都改进了这一点,得分比机会基线高出 7--14 个百分点,并将有序 MAE 从 0.98 改进到 0.80--0.89。三教师伪标签框架可以在没有专家注释的情况下进行所有比较。总之,这些发现为这种尚未充分探索的模式提供了第一个基线,并为构建立体医学成像视觉语言系统提供了实用指导。