论文
从文本决策到像素:Jev风格视觉选择模型研究
From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model
摘要
视觉软件常常需要对给定的候选集合做出决策,而不是生成一段解释。我们提出PixelJev,一个原生图像决策接口,使用小型开放多模态模型将图像、任务指令和运行时候选集合映射为结构化选择及候选条件概率。其初始实现通过现有的语言模型读取接口统一识别与多选视觉问答,并分别评测冻结推理、语言侧适配和留出校准三种选项。在七项基准评测中,64样本源域适配在多个优化种子下将Pets准确率从60.13%提升到92.40%,并能迁移到自然重采样、新纹理标签和未经目标拟合的A-OKVQA,而冻结推理已可支持两个VQA任务。在Pets和ScienceQA上进行的匹配纯提示后续实验把Pets的大幅提升归因于适配,并在适配后的VQA中识别出候选读取在输出有效性方面的较窄收益。专用DINOv2探针在源域识别上仍然更强,冻结4B在DTD和ScienceQA上强于适配2B,且准确率提升并不保证校准的目标概率。这些发现确立了一个通用视觉决策模型的可行起点,并指出剩余需求:模式鲁棒性、跨模型家族迁移和视觉证据的可靠使用。