论文
伪造的同行判断误导多模式 LLM 评审小组:来源盲锚定和小组共识验证
Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification
摘要
多模式 LLM 评审小组可以交叉引用同行,但引用的同行判断本身可能是不可信的。我们将源盲锚定暴露为视觉语言模型 (VLM) 面板中的文本级攻击面。引用独立的视觉判断会在自我和同伴框架下产生巨大的锚定差距(19--26 个百分点)。匹配内容、仅标签的控件仅将损坏率改变 $-0.17$pp (95\% CI $[-0.68,0.35]$),表明自我/同行标签本身并不能解释效果。在我们测试的构造下,故意生成的简洁错误引用推翻最初正确判决的频率比自然发生的错误同行语句高出 1.5--2.7$\times$,引导程序 95\% CI 不包括两个数据集和七个 VLM 法官的奇偶校验。由于这两个语句群体在选择和形式上有所不同,因此该比率衡量的是测试攻击下的不同损害,而不是仅源于来源的因果效应。然后,我们引入小组共识验证,将报价与独立收集的盲选进行交叉检查。它阻止了 84.9% 的捏造攻击,将其净损害减少了 97.5%,并在留一法重新验证下保留了对真实对等信息的积极但统计上不确定的点估计。这些结果确定了低成本的攻击面和具体的防御,以实现更安全的多模式协作评估。