论文

移动目标:对开源聊天 LLM 发布线的信任基准分数漂移的纵向审计

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

模型评测鲁棒性、公平性与可信度评测

摘要

在 chat-LLM 发布系列上报告的信任基准分数通常会跨同一行的多个检查点进行,就好像基础模型在版本之间没有发生变化一样。我们测试这个假设。我们审核了四个开源发布系列(Yi、Qwen、Mistral 和 Gemma),每个系列连续三个公共版本。每个检查点都根据五个聊天评估基准的固定 200 项篮子进行评分:TruthfulQA、BBQ、ToxiGen、CrowS-Pairs 和 XSTest,在三个提示模板下。五个基准变体中有四个是非规范的,其中两个是合成替代基准。平均绝对相邻代分数漂移率是基于独立性的计数级零假设参考值的平均值的几倍。当我们放弃基准、放弃发布线、切换到严格评分或限制为恒定参数大小转换时,它会保持在同一范围内。在此审核设置中,引用的信任分数应被视为受检查点限制。它应该在每个重大新版本上重新衡量,而不是继续下去。封闭的 API、更大的模型、规范协议分数和基准项目子集不确定性超出了范围。