论文

看不到的信息仍影响学习:六十个系统的预注册证据遮蔽验证

What You Can't See Is Still What You Learn: A Preregistered Sixty-Society Confirmation That Evidence Masking Drives Compositional Generalization

模型评测模型行为与机制分析

摘要

限制模块可读内容可能改善系统学会计算的能力。我们在预注册确认实验中测试这一点:六十个四单元系统共享冻结语言模型,通过学习得到的连续信息包通信。五种条件改变证据遮蔽、归属标记及用中性填充替换他方证据;在一个新任务世界上使用六个初始化簇,每簇两种数据顺序。两种设置都提供标记时,遮蔽在留出的二操作和三操作组合上提高准确率,配对差值中位数分别为0.846和0.859;全部十二对均超过要求裕量,完整预注册行为标准通过。无标记复现也通过。没有全局可见系统通过标记遵循检查,因此可用角色信息的作用仍未解决。填充条件产生七个完全泛化系统,但分解标准结果不确定。全部十八个审计过的遮蔽系统中,信息包干预在符合条件案例上遵循预期中间值变化;这些有限且以成功为条件的审计不能确立中介关系。结果确认了所测遮蔽设置的明显优势,但细化归因与普适性仍待研究。协议、结果和检查点已公开。