多模式人工智能何时能发挥作用?用于卫星地面网络频谱管理的视觉语言模型和 CNN 的诊断互补性
When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks
摘要
用于无线网络管理的视觉语言模型 (VLM) 的采用正在加速,但对于这些大型基础模型在频谱相关任务中优于轻量级卷积神经网络 (CNN) 的哪些方面还没有系统的了解。本文首次对非地面网络和地面网络 (NTN-TN) 协作系统中频谱热图理解的 VLM 和 CNN 进行诊断比较。我们引入了 SpectrumQA,这是一个包含 108K 视觉问答对的基准测试,涵盖四个粒度级别:场景分类 (L1)、区域推理 (L2)、空间定位 (L3) 和语义推理 (L4)。我们使用冻结的 Qwen2-VL-7B 和经过训练的 ResNet-18 在三个 NTN-TN 场景上进行的实验揭示了明显的任务依赖性互补性:CNN 在严重性分类 (L1) 上实现了 72.9% 的准确度,在空间定位 (L3) 上实现了 0.552 IoU,而 VLM 仅使用三个上下文中的示例就能够以 F1=0.576 的方式进行语义推理 (L4),而这种能力在 CNN 架构中根本不存在。思想链(CoT)提示进一步将 VLM 推理提高了 12.6%(F1:0.209->0.233),同时对空间任务的影响为零,证实了互补性植根于架构差异而不是提示限制。将监督任务委托给 CNN 并将推理任务委托给 VLM 的确定性任务类型路由器的综合得分为 0.616,比单独使用 CNN 提高了 39.1%。我们进一步表明,VLM 表示表现出更强的跨场景鲁棒性,在 6 个传输方向中的 5 个方向上性能下降更小。这些发现提供了可行的指导方针:部署 CNN 进行空间定位,部署 VLM 进行语义谱推理,而不是将它们视为替代品。