论文

我们编写理论的方式是否会改变 LLM 从中构建的程序? LLM 理论到程序翻译中渲染器格式的前瞻性随机研究

Does the way we write a theory change the program an LLM builds from it? A prospective randomized study of renderer format in LLM theory-to-program translation

模型评测鲁棒性、公平性与可信度评测

摘要

口头理论无法运行:将其转化为可执行模型需要对变量、干预和交互进行选择。我们测试了相同理论内容的呈现是否会系统地改变 大语言模型 生成的程序。在一项前瞻性预注册随机实验中,16 个独立分配位在结构化干预合约和连接的散文之间分配了 32 个成对的渲染器插槽。两个固定的 LLM 快照翻译了五个匿名理论帐户,以冻结的稀疏二次语言生成了 320 个预先授权的单次程序。确定性评估器测量原子有限差分响应 (H1) 和混合交互响应 (H2)。两个主要终点评估了跨模型匹配距离减少和封闭集相同账户可识别性,并通过精确的随机化推理和跨符号线性和量级管道评估的 27 个预先注册的支持标准。 H1和H2都返回了注册判决NOT_SUPPORTED; 108 项标准评估中仅 19 项通过。同一账户的可识别性仍然接近偶然(AUC 0.469-0.523,相对于注册阈值 0.80)。一个 H2 匹配距离端点移动并在符号线性管道中幸存下来,但相应的震级结果错过了注册的效应大小下限,因此不满足联合支持规则。因此,渲染器格式不会产生预先预测的统一的、族不变的、可分类的行为几何形状。结果为 LLM 理论到程序翻译中的规范格式效应设定了具体的边界,并提供了完全可审计的随机设计、数据集和用于研究可执行形式化的软件。