VectraYX-Vision-1B:Sub-2B 西班牙/拉美网络安全视觉语言模型及其视觉基础的限制
VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model, and What Limits Its Visual Grounding
摘要
我们构建了 VectraYX-Vision-1B,这是一种供离线使用的 2B 级西班牙/拉美网络安全视觉语言模型,并测量了限制其视觉基础的因素。冻结的 1.04B 参数解码器通过可训练的投影仪耦合到冻结的视觉编码器:首先是 SigLIP,然后是 Qwen2-VL-2B 塔,其投影仪形状适合 llama.cpp 的 mmproj 导出。使用 SigLIP,修复了五个 微调 缺陷后,具有混洗图像控制的九场提取门在保留编码器且不添加文本提示的每个配置下传递相同的 2/9 场。冻结特征探针解释了原因。用自己的合并移植 Qwen2-VL 塔会读取 SigLIP 从未读取过的 8 个半字节地址(0.00 到 0.81 完全匹配)。在 B8 上(2,040 个项目、34 个字段、16 个模板、随机图像和最佳常数控件),9 个字段通过 Qwen-tower 检查点,全部位于经过训练的模板字段对内。屏幕截图工具识别 (B6) 恰好为 0.000。这不是感知上限。库存 Qwen2-VL-2B 在我们的像素预算下以 0.93 的单词召回率(使用我们的信箱处理为 0.52)转录相同的图像。仅针对 B6 的任务格式和渲染系列对投影仪进行训练,可将 B6 工具识别率提升至 0.96,召回率提升至 0.48-0.51。因此,在这种冻结主干设计中,对渲染文本的感知是存在的并且是可训练的。证据范围很窄。 B6 几乎是该投影仪的分布,它也忘记了 B8 的一部分(在保留检查中平均场精度为 0.53 至 0.29);运行是单种子的,目前还没有检查点同时拥有这两种种子。我们记录了四个Harness缺陷,撤销了早期的 B6 分数,并发布了代码、基准测试和检查点。