论文

VisualDeltas:从视觉质量扰动中学习偏好

VisualDeltas: Learning Preferences from Visual Quality Perturbations

模型训练偏好优化

摘要

我们提出VisualDeltas,一个轻量偏好学习框架,从多模态数据的视觉质量变化中提取监督。通过利用图像质量对视觉感知与推理的系统性影响,VisualDeltas在不依赖人工标注或外部教师的情况下诱导出信息丰富的偏好信号。该框架同时支持无标签和有标签两种模式,在存在监督时可灵活利用。在多样的多模态基准和模型规模上,VisualDeltas持续优于拒绝采样微调并改善泛化,且可自然扩展到一系列视觉退化。

VisualDeltas:从视觉质量扰动中学习偏好
图7:分辨率–准确率关系。7B模型表现出特征性的三阶段模式:高分辨率(100%–40%)下稳定,临界区(40%–20%)内快速退化,极低分辨率(20%–10%)下严重失效。3B模型呈现相似模式但准确率系统性更低,证实了这一现象跨模型规模的稳健性。