用于快速无线电突发检测的通用视觉语言模型:针对专用检测器的零样本基准
Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector
摘要
快速无线电突发 (FRB) 检测越来越依赖于专门的深度学习模型,这些模型需要大量特定于任务的训练集,并且如果不重新训练就无法重新定义。我们评估小型、开放权重、本地运行的通用视觉语言模型(VLM)是否可以在零样本、仅提示机制下检测动态光谱中的 FRB。在 2000 个模拟 L 波段光谱的平衡二进制基准上,Gemma 4 E2B 的准确度达到 94.05\%,在统计上与专用检测器 SwinYNet (92.85\%) 没有什么区别,结构化 RFI 的误报率要低得多(4.8\% vs. 24.6\%),并且在纯噪声上没有误报,尽管 SwinYNet 排名完美(ROC-AUC 1.0000)对比 0.9520)。仅重写提示就可以重新配置相同的模型进行三级 FRB/RFI/噪声分类,达到 86.0\% 的准确度,没有一个错误的 FRB,同时在 1.0--1.5 秒内对每个 2 秒频谱进行分类,比观测本身更快。不加修改地应用于 FAST-FREX 的 1600 个真实 FAST 观测,它们几乎完美地拒绝了真实干扰(1000 个阴性中的 2 个和 5 个误报),但仅恢复了 600 个编目突发的 28.5% 和 27.0%,而 SwinYNet 在同一文件上报告的恢复率为 95.7%。通过图像中的分散信号对这些突发进行分层显示了输入表示而不是分类器的限制,回想一下,在扫描明确的情况下上升到 84--85\%,并在 2 s 未去分散全频带视图中没有携带可检测信号的 13\% 的正值上崩溃到 1\%。模拟的突发亮度中位数几乎高出 30 倍,并且在匹配的亮度下,召回结果的一致性在几个点之内。