论文

MWE-ECL:可恢复的远程上下文并不总是覆盖本地词汇先验

MWE-ECL: Recoverable Long-Range Context Does Not Always Override Local Lexical Priors

模型评测评测方法与指标

摘要

长上下文评估通常测试模型是否可以恢复遥远的证据,但可恢复性并不能保证行为影响。我们测试了这样的预测:一个遥远的话语锚点可以保持明确的可恢复性,但无法改变熟悉的多词表达的本地首选阅读;当模型的无锚点默认值与锚点冲突时,此类失败应该集中,而先前正确的决策仍然大部分保留。我们引入了多词表达有效上下文长度(MWE-ECL),这是一种双语诊断,其匹配的锚检索、无锚先验和解释提示分别测量显式可恢复性、模型观察到的默认值和锚条件决策。在共享 0-128K 网格上的八个英语部署面板中,先前冲突项目的检索控制准确度为 0.989-1.000,先前冲突覆盖范围为 0.806-1.000(在正确检索后为 0.809-1.000),并且先前正确决策的保留仍为 0.977-1.000。在一个提示中查询检索和解释的同一调用控件再现了 DeepSeek V4 Pro 的差距(1.000 检索与 0.900-0.920 解释),表明单独的调用并不是其唯一的解释;其他两个模型中较小或不存在的差距限制了其普遍性。对于 DeepSeek V4 Flash,单独的提示拟合测试在 512K 和 1M 下以较低的解释保留了完美的检索,而箔一致的线索对无锚先验的改变远远超过检索;跨模型线索效应是异质的。单独报告的 10 个中国家庭子集显示出类似的描述性差距,但某些模型的不完善检索阻止了仅整合归因。因此,MWE-ECL 评估显式可恢复的远程上下文是否改变了竞争的本地语义决策。