论文
稠密坐标列表微调在LLM中诱导可控干扰表面
Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models
摘要
微调视觉语言模型以发出密集的坐标列表可以改善视觉基础,但也改变了模型序列化、重复和终止结构化输出的方式。我们将这种行为作为生成和控制面来研究。在 Gemma 4 12B 中,高容量 q/k/v/o LoRA 将类别感知 F1@0.3 从 0.007 提高到 0.448,同时引起重复尾部压力(重复率 0.080,最大重复 23)。 q/v 排名扫描将排名 4-64 的最大重复次数保持在 21-22,显示了容量持久性。目标信号是可分离的:对象级重复停止删除精确的重复记录(重复率0.000,最大重复1),同时保留F1(0.494至0.490)和更严格的F1@0.5(0.381至0.385)。结构轴探针将效果定位到 bbox 坐标对象列表;密集的非 bbox 和空间/计数 JSON 保持重复干净,包括在高容量适配器下。 Qwen3-VL-8B 再现了干净的受控端点(F1@0.3 0.318,重复率 0.000),COCO 2017 再现了采集加重复压力。因此,密集的坐标列表适应创建了一个可以测量和控制的结构约束、跨族干涉表面。