论文
共识何时意味着正确?测量一致性准确度与保留语义的重新渲染的耦合
When Does Consensus Mean Correctness? Measuring the Agreement-Accuracy Coupling with Semantics-Preserving Re-Rendering
摘要
模型在扰动输入上的一致性既可以用作无标签可靠性信号,也可以用作自我训练目标,前提是一致性跟踪正确性。这种耦合很少被直接测量:自然图像扰动仅通过假设保留意义,并且没有确切的答案关键来定位错误。科学图形消除了这两个障碍,图形是由程序从数据中绘制出来的,因此重新绘制它会产生在语义上通过构造等效的图像,并共享程序上的精确答案。我们构建了 RENDEQ(此类渲染等价集的生成器),并测量了三个开放权重 VLM 上的耦合,检查了三个独立实例中的每个发现。重新渲染在准确性和可靠性方面都优于重新采样。在三个模型中的两个模型上,协议击败了带有证据的基线,即平均词元对数概率,在第三个模型上达成了平局,扭转了可追溯到渲染管道故障的中间的、有缺陷的复制。这背后的分散集中在一个风格因素,即绘图库,是第二大因素的两倍多,并且比本底噪声高一个数量级。模型自身的交叉渲染共识上的 微调 反转:五次复制运行中每一次的准确性都会下降,这与自然图像上已发布的结果相反。协议只能证明正确性高于由模型错误的分散程度设定的阈值,而奖励协议的目标恰恰会破坏这种分散性。