论文
模型链:偏差稳健的 LLM 法官的跨模型审计
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
摘要
LLM 越来越多地充当自动法官,但他们的判断仍然容易受到认知偏差的影响。现有的缓解措施主要依赖于即时驱动的去偏差,这种方法对于偏差类型来说很脆弱,或者依靠人工评估,而这种方法无法扩展。我们研究\emph{模型链}(CoM),这是一种自动审计管道,其中第二个模型在产生最终判断之前检查第一个模型的推理轨迹。关键的设计问题是审计员是否应该是同一模型、同族模型还是不同族模型。通过来自 6 个系列的 9 个模型、4 个认知偏差和 4 个事实数据集,我们发现审计师身份在两个方面很重要。首先,独立偏差抗性并不能预测审计有效性:Kimi-K2.5 是在多个偏差上最强的独立模型,但对于 Qwen2.5-72B 的偏差痕迹而言,审计效果较弱。其次,最好的审计师是有偏见的:GPT-4o 在随波逐流、权威和干扰方面最强,而 GLM-5 在阿谀奉承方面最强。我们通过基于偏见的审计员选择规则来实施这些发现,该规则根据偏见类型,根据功能多样性、基于偏见的独立阻力和校准的审计有效性对候选人进行评分。在校准/测试分割下,选择器在四个有偏差的切片中达到最高准确度(最强单一固定审计师为 0.884 vs. 0.824,无审计基线为 0.805)。我们在 https://anonymous.4open.science/r/chain-of-models-B585 发布数据、配置和 LLM-agent 技能。