论文

语言模型中的能力来源:社会推理的案例研究

Capability Provenance in Language Models: A Case Study in Social Reasoning

模型评测模型行为与机制分析

摘要

我们使用训练数据归因作为能力发现的可解释工具,映射预训练语料库的哪些区域支持社会推理与 OLMo3-7B 中的 STEM 推理。训练数据归因衡量每个训练文档对基准模型预测的影响程度,但文档级分数噪音太大,无法识别哪些语料库区域支持哪些功能。我们在从重复数据删除的 Dolma3 组合中提取的工作集上计算基于梯度的归因(来自 Bergson 的 TrackStar),对 WebOrganizer 的 24 格式 x 24 主题分类法(576 个箱)的总体影响进行计算,并在 2x2 设计中对比不同领域(社交与 STEM)和能力类型(推理与知识)的基准对:SocialIQA 和 MMLU 社会科学与 ARC-Challenge 和MMLU 干。社会推理和 STEM 推理利用了性质不同的语料库区域,并且推理层面上的对比比知识层面上的对比更加鲜明。有针对性的机器遗忘提供了部分因果验证:忘记高归因主题(例如,SocialIQA 的文献)比主题内随机基线更能降低对齐基准。我们在 https://github.com/HCAI-Lab-GT/capabilibara 和 https://huggingface.co/HCAI-Lab-GT 上开源所有代码、数据工件、影响力分数和检查点。