论文

语言模型中的领域适应和推理框架:历史宇宙学的对照实验

Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology

模型评测模型行为与机制分析

摘要

我们研究领域适应如何使用历史宇宙学作为受控环境来重塑语言模型中的解释行为。在第一阶段,我们在前哥白尼语料库上从头开始训练一个小型语言模型,其中明确的日心参考被删除,并评估是否仍然出现地球运动或日心延续。在第二阶段,我们在同一语料库上使用 QLoRA 微调更大的预训练模型,以研究适应如何修改解释框架和宇宙学立场。使用 LLM 作为判断框架来评估模型输出,该框架标记了宇宙学立场(地心、日心或模糊)和解释框架(前现代与现代)。在第一阶段的约束环境中,较小的模型偶尔会产生局部地球运动延续,但这些仍然是全局不稳定的,不足以支持连贯的宇宙学推理。在第二阶段,微调 引发了向前现代解释框架的重大且统计上显着的转变,而条件宇宙立场分布在这些框架内保持相对稳定。因此,地心产出的增加主要来自解释性制度的重新分配,而不是立场的直接改变。这些结果表明,领域适应可能主要重塑产生延续的语言框架,而这些转变继而出现立场的变化。