论文
版本更新下不存在能预测LLM样本级退化的普适信号
No Universal Signal Predicts Sample-Level LLM Regression under Version Updates
摘要
前沿LLM更新频繁,且总体上通常优于前代。但总体提升对单个样本说明甚少:一次更新仍可能造成样本级退化,即旧模型下正确的回答在新模型下变为错误。本文研究如何利用推理时可得信号预测此类退化。我们在统一的增量价值检验下比较单模型信号(置信度、logit边际、注意力熵)与跨版本信号(输出KL散度、似然漂移、token级KL、表示漂移),该检验隔离每个信号相对置信度基线的增益。在三个任务族(多选问答,即MCQ;数学推理;代码生成)的六个基准和六个模型更新对上,我们发现:(1)信号有效性依赖任务:置信度在MCQ和较简单数学上最强,而似然/KL类信号在更难的数学和代码上带来最频繁的增益;(2)也没有任何信号在所有模型更新上普遍最佳;(3)某些跨版本信号即便在置信度失效时仍保有信息量,包括无标签情形,这支撑一个概念验证的选择性回退机制,把高风险样本路由回旧模型。从业者可利用这些任务级模式选择对给定更新应信任哪种退化信号。代码见 https://github.com/jiashengsally/llm-regression-signals。
