论文
读取与转向开源语言模型中的材料科学机制表示
Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model
摘要
大语言模型能回答科学问题,但正确的输出不能揭示模型是否表示或使用了背后的物理。本文以三个开源Gemma 4模型为对象,识别材料科学机制信息的三个可实验分离的签名:选择性概念可读性、定性本构取向的关系编码、以及对受约束工程答案的因果、上下文依赖控制。我们组合匹配的直接与雅可比词表读出、无选项的状态几何、60条定律的反事实基准与因果干预。在50份留出材料描述上,三个独立拟合的雅可比透镜复现了概念排序;来自两种读出的无目标词集使盲法识别10个机制家族中的9个成为可能。一个独立的72提示基准产出了机制专属的隐状态邻域,但精确图审计显示这种表观的物理组织同样可由数值比较解释。因此我们比较只在物理输入方向上相反、其余完全相同的提示,追问隐状态的移动是否遵循所给本构定律:这些状态变换在60个冻结关系上给直接、物理中性与逆向定律排序,并正确取向40个方向性定律中的39个,而词汇对照接近随机。双向干预在全部12个匹配案例中把答案概率推向或推离物理恰当的结果,反事实状态补丁跨机制与答案格式迁移相反的决策信号。物理关系因此在受控状态变化中比在绝对状态中更可见。
