论文

读取与转向开源语言模型中的材料科学机制表示

Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model

模型评测模型行为与机制分析

摘要

大语言模型能回答科学问题,但正确的输出不能揭示模型是否表示或使用了背后的物理。本文以三个开源Gemma 4模型为对象,识别材料科学机制信息的三个可实验分离的签名:选择性概念可读性、定性本构取向的关系编码、以及对受约束工程答案的因果、上下文依赖控制。我们组合匹配的直接与雅可比词表读出、无选项的状态几何、60条定律的反事实基准与因果干预。在50份留出材料描述上,三个独立拟合的雅可比透镜复现了概念排序;来自两种读出的无目标词集使盲法识别10个机制家族中的9个成为可能。一个独立的72提示基准产出了机制专属的隐状态邻域,但精确图审计显示这种表观的物理组织同样可由数值比较解释。因此我们比较只在物理输入方向上相反、其余完全相同的提示,追问隐状态的移动是否遵循所给本构定律:这些状态变换在60个冻结关系上给直接、物理中性与逆向定律排序,并正确取向40个方向性定律中的39个,而词汇对照接近随机。双向干预在全部12个匹配案例中把答案概率推向或推离物理恰当的结果,反事实状态补丁跨机制与答案格式迁移相反的决策信号。物理关系因此在受控状态变化中比在绝对状态中更可见。

读取与转向开源语言模型中的材料科学机制表示:论文配图
图 11:自动解释器能否仅根据发现的单词识别材料机制? (A) 二十个候选集(来自两个读数中的每一个的十个机制族)被打乱并剥离了原始提示、方法标识和答案键。自动解释器在五次顺序随机传递中为每组选择十个系列标签之一;它没有解决最初的工程问题。 (B) 每次通过的准确度都远高于 10% 的几率水平。 (C) 每个家族的多数票正确性和读数:两列对于九个家族都是正确的,并且都错过了分裂。因此,两个自然组装的词汇都带有可识别的材料含义,在二次测试中没有雅可比特定的优势(配对差值 0,p=1.0p=1.0)。 (D) 每个点都是一个雅可比族。横坐标是预先声明的精确期限恢复;垂直坐标是正确分配无目标单词的自动传递的分数。两种测量方法上的分裂都很弱,但即使确切的目标很少排名靠前,大多数家族也能在语义上被识别,只产生弱关系(ρ=0.254\rho=0.254)。因此,受控回收和无目标识别可衡量互补特性。这五次通过是来自一个自动化系统的重复判断,而不是独立的科学专家(因此该数字仅限于可重复的基于机器的语义验证)。