论文
InfiCoEvalChain:一个基于区块链的协作式 LLM 评估去中心化框架
InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation
摘要
大语言模型(LLM)的快速发展对评估可靠性提出越来越高的要求,然而当前的集中式评估存在不透明、过拟合以及硬件导致的方差等问题。我们的实证分析揭示了现有评估中一个令人担忧的不一致现象:单个模型在 HumanEval 上十次重复运行的标准差(1.67)实际上超过了官方排行榜前十模型之间的性能差距(0.91),使当前排名在统计上岌岌可危。为缓解这些不稳定性,我们提出一个去中心化评估框架,通过跨异构计算节点的大规模基准测试实现硬件与参数的多样性。该框架借助基于区块链的协议,激励全球贡献者充当独立验证者,并使用稳健的奖励系统确保评估完整性、抑制不诚实参与。这种集体验证将评估从“集中式黑箱”转变为“去中心化背书”,由多方共识与多样的推理环境共同产生更稳定、更具代表性的指标。实验结果表明,该去中心化评估框架将同一模型十次运行的标准差降至 0.28。相比传统框架的这一显著改进为模型排名提供了更高的统计置信度。我们已完整实现该平台,并将很快向社区发布。
