论文

组合崩塌:稳定的事实知识并不意味着组合推理能力

Composition Collapse: Stable Factual Knowledge Does Not Imply Compositional Reasoning

模型评测评测方法与指标

摘要

后训练通常通过聚合基准分数来评估,将多跳推理视为单一能力——仿佛答对更多问题的模型必然更擅长组装事实。我们证明这一假设可能具有误导性:原子知识在统计上不可区分的后训练配方(recipe),其组合行为却相差40个百分点以上;我们将这一现象称为组合崩塌(composition collapse)——即无法将稳定已知的事实组装成推理链的系统性失败,而聚合指标对此不可见。我们提出双门(double-gate)协议,将估计对象(estimand)从聚合的组合能力差距改为以稳定原子访问为条件的残余组合失败,并将后训练收益分解为三个独立通道:原子稳定性、残余组合与临界深度。在一个跨越深度2至11、覆盖四种后训练配方的时间性事实链基准上,这一分解揭示出后训练目标以聚合指标所掩盖的方向改变组合能力,并提示有关多跳推理改进的论断应附带原子门控条件下的组合指标。诊断性探针进一步表明,相当大比例的所测组合失败反映的是生成时的计算约束,而非永久性的组合无能。

组合崩塌:稳定的事实知识并不意味着组合推理能力:论文配图
图 1:用于测量残留成分失效的双门协议。多跳问题被分解为原子事实和对齐的子问题。 I. 原子稳定性验证跨释义对每个原子的稳定和正确访问。二.子问题正确性验证每个子问题是否单独正确回答。三.剩余成分失败衡量在通过两个门后原始多跳问题是否仍然被错误回答。这将组合错误与不稳定的知识访问分开,并支持三通道分解为 Δatom\Delta_{\text{atom}}、Δcomp\Delta_{\text{comp}} 和 Δdepth\Delta_{\text{深度}}。