论文
OraclePhys:LLM 微调 结构力学的系统框架
OraclePhys: A Systematic Framework for LLM Fine-Tuning on Structural Mechanics
摘要
语言模型从 微调 中内化的内容通常是事后诊断的。我们将其作为实验变量。 OraclePhys 是一个系统化的 微调 框架,由三个组件组成: OraclePhys-Bench,一个精确分级的结构力学基准,其有限元预言机对每个答案和反事实编辑进行评分——没有人工标签,没有 LLM 判断; OraclePhys-30K,基于字节相同结构描述的七种答案形式的监督数据集;以及针对七种形式和三种验证者角色的受控训练研究。该研究得出两个结果。首先,标签的答案形式——而不是它的位数——因果地决定了 微调 所教导的内容:排名目标安装了一个分布外的前向模型,其中未经训练的基础位于猜测先验,标量目标充其量是部分目标,布尔值无法检测到;矢量标量鸿沟在第二个物理域、第二个模型族和解释的评估表面中幸存下来。其次,书面或分数过滤的答案安装了此功能,而优势加权分数(GRPO)提高了奖励,但使模型在统计上等同于其在测试的配方和预算内的物理起点 - 仅足以用于路由。经过训练的 8B——第一个关于空间结构响应的 LLM——达到了任务的数据精度前沿:在零和 32 次发射时高于前沿 LLM,达到专家水平。标签中关于目标计算的说明是 微调 所教导的;你训练什么,你就走什么路线。