论文

谁来验证基准?去中心化的大语言模型评测信任机制

Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

模型评测评测方法与指标

摘要

大语言模型基准可以建立组织声誉并吸引客户,但前提是结果透明且可验证。关于DeepSeek R1优于OpenAI o1的未经证实的说法,加剧了2025年1月27日的市场恐慌,当天英伟达市值蒸发5890亿美元。然而,厂商基准往往依赖荣誉制度。学术界的重新评估与独立排行榜曾发现未披露的专有模型变更、被污染的训练数据和选择性报告。LLM-as-a-judge方法通过减少人工评审来规模化评测。然而研究表明,评审可能表现出身份感知偏见,根据答案的来源模型而非其质量来打分。这一偏见在政治敏感、推理密集和偏好类任务上尚未得到充分测量与纠正。我们使用七个验证器模型来考察这一问题:GPT-OSS 120B、Llama 3.3 70B、GLM 5.1、Qwen3 32B、DeepSeek V4 Pro、Mistral Large3和Sarvam M。它们就58个事实、推理、政治与偏好类问题,为三个主要模型的匿名与披露身份的回答打分。身份披露使事实类问题得分略升,对压力推理任务有中等影响,并对地缘政治敏感话题造成大幅变化。值得注意的结果包括GLM5.1(+7.00分,p = 0.0249)和Llama 3.3 70B(+1.56分,p = 0.00)。我们还提出一个基于区块链的提交-揭示(commit-reveal)协议,使用以太坊兼容账本上的自主经济智能体(Autonomous Economic Agents)。在第一阶段,每位评审在候选身份揭示之前记录其分数与密盐的单向哈希。在第二阶段,身份与原始分数被披露并在链上验证。这创建了防篡改的审计轨迹,将盲评与事后声称分离,并减轻独立研究者与排行榜运营者的验证负担。

谁来验证基准?去中心化的大语言模型评测信任机制:论文配图
图1:系统架构图