看不见的证据如何影响学习:限制可见性促进共享模型多模块系统的组合泛化
What You Can't See Is What You Learn: Restricted Evidence Visibility Favors Compositional Generalization in Shared-Genome Language-Model Societies
摘要
多模块系统通常让每个模块都看到完整输入。我们检验限制证据可见性是否会改变基于梯度的训练所发现的解。由四个单元组成的系统共享一个冻结的预训练语言模型和一个低秩适配器,仅通过两个与模型宽度相同的连续向量,按固定接力顺序通信。在一项预先封存的自然语言函数组合任务上,我们训练了十对匹配的受限可见性与全局可见性系统;每对系统的初始化字节、训练顺序、token布局、参数和计算量均相同,唯一差别是注意力掩码。十对中有九对,受限系统在两种组合深度上都至少领先全局系统20个百分点;配对优势中位数分别为0.7648和0.6050。切断通信后,每个受限系统都降至随机水平;对于组合函数从未出现在训练中的程序,深度为三时的优势仍为0.558。在六个经过审计的受限系统中,各受测接口上的同值消息包移植以0.94—1.00的比例保持原有行为;破坏性干预使性能崩溃,反事实消息包则把输出引向数学上预测的答案。唯一表现优异的全局系统也依赖通信,但其同值消息包无法在不同任务样本间互换。因此,限制可见性并非组合能力的必要条件;在本实验协议下,它显著增加了发现可泛化接力机制的概率,并有利于形成可复用、按值索引的接口。不过,完整的预注册检验仍未通过:受限组深度为三时的准确率中位数为0.6988,低于0.70的门槛。更早的资格检验中,十个模型也都未完全通过;其中一个满足全部任务性能要求,但十个模型都未能保持普通语言能力,因此该系统的使用范围应限定为有明确任务门控的场景。