论文

版本更新下不存在能预测LLM样本级退化的普适信号

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

模型评测鲁棒性、公平性与可信度评测

摘要

前沿LLM更新频繁,且总体上通常优于前代。但总体提升对单个样本说明甚少:一次更新仍可能造成样本级退化,即旧模型下正确的回答在新模型下变为错误。本文研究如何利用推理时可得信号预测此类退化。我们在统一的增量价值检验下比较单模型信号(置信度、logit边际、注意力熵)与跨版本信号(输出KL散度、似然漂移、token级KL、表示漂移),该检验隔离每个信号相对置信度基线的增益。在三个任务族(多选问答,即MCQ;数学推理;代码生成)的六个基准和六个模型更新对上,我们发现:(1)信号有效性依赖任务:置信度在MCQ和较简单数学上最强,而似然/KL类信号在更难的数学和代码上带来最频繁的增益;(2)也没有任何信号在所有模型更新上普遍最佳;(3)某些跨版本信号即便在置信度失效时仍保有信息量,包括无标签情形,这支撑一个概念验证的选择性回退机制,把高风险样本路由回旧模型。从业者可利用这些任务级模式选择对给定更新应信任哪种退化信号。代码见 https://github.com/jiashengsally/llm-regression-signals。

版本更新下不存在能预测LLM样本级退化的普适信号:论文配图
图3:各任务上信号带来的增益。无着色的第一列报告新模型置信度的绝对 CV-AUROC。着色单元格报告加入每个信号后的 Δ_CV-AUROC;红色表示提升,蓝色表示下降,“n/a”表示信号不可用。MCQ 显示旧模型边际、注意力熵和表征漂移;生成任务显示新轨迹似然漂移、top-k token KL 和表征漂移。附录表 A4–A6 报告所有变体与精确数值。