论文

小语言模型抽象推理的系统研究

A Systematic Study of Small Language Models on Abstract Reasoning Tasks

模型评测模型能力评测

摘要

抽象推理基准的端点准确性并不能揭示语言模型是否获得了可转移的规则或适合特定于分布的规律。我们在 ARC-TGI 基准上研究小语言模型的这种区别,该基准将抽象网格转换组织为可控任务族,并支持重采样、空间移位和跨基准传输。在超过 1,000 次运行中,我们在监督的微调下分析了纯解码器、编码器-解码器和混合专家模型系列。我们研究了技能获取的效率和稳定性、超出训练分布的稳健性、与模型族和任务制定的交互,以及伴随行为差异的分层注意力特征。可以实现相当大的分布内准确度,但获取对优化很敏感,并且在任务族之间分布不均匀。在训练分布之外,包括保留规则但网格规模发生变化时,性能急剧恶化。更大的训练集深度和广度会产生不均匀的增益,而附加上下文示例的效果取决于模型系列。可执行规则归纳还可以产生在直接网格生成下未观察到的正确解决方案。在选定的任务上,注意力诊断显示出不同的注意力和上下文依赖性特征,但没有建立一般的因果机制。总体而言,抽象推理得分取决于模型、适应机制、评估分布和响应格式。

小语言模型抽象推理的系统研究:论文原图
图 8:RQ1:超参数响应分布。 D(上)、MoE(中)和 ED(下)的测试历元、学习率、预热和权重衰减值的精确匹配精度。点是单独的扫描配置,小提琴总结了它们的边际分布,红线连接边际均值。每个面板都比其他超参数边缘化,因此应被视为诊断反应概况,而不是孤立的治疗效果。