论文

TriCLE:边缘部署细粒度集群的三模态视觉语言推理

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

模型优化端侧模型

摘要

用于空中观测的边缘平台必须在有限的内存、有限的计算和间歇性连接的情况下解释飞机图像。对于标准的仅 RGB 识别模型和通用视觉语言模型来说,此设置很困难,特别是当校准的热和 LiDAR 飞机数据不可用时。我们提出了 TriCLE,一种面向应用的三模态视觉语言系统,用于边缘约束下的飞机分类分组。 TriCLE 根据单个 RGB 飞机图像生成保留结构的 FLIR 式热视图和伪 LiDAR 深度投影,然后将对齐的视图与紧凑型 Qwen3-VL 主干中的任务指令融合。该模型符合基于推进力、机身系列、尺寸、设计时代和配置的专家飞机分类法,因此其输出反映了工程相关的相似性,而不仅仅是表面外观。我们评估了有监督的 微调、旋转保持 SFT 和三种策略调整策略:GRPO、GSPO 和 DAPO。序列级 GSPO 提供了最强的验证性能,在有效飞机输出上达到 88.33% 的验证精度和 0.91 的加权 F1。在保留的飞机测试分区上,GSPO 实现了 78.00% 的准确度和 0.793 加权 F1,同时保留了 94.00% 的可解析输出格式。经过 4 位量化和注意力记忆优化后,对齐的 4B 模型适合 8GB 部署目标,并在 1.48 秒内处理每个三模态三元组。这些结果支持 TriCLE 作为可解释、边缘可行的飞机分组的实用原型,同时强调需要对真实对齐的热和 LiDAR 传感器流进行进一步验证。