论文

形式,而非内容?通过冻结小代码模型中的提示和权重对学习错误条件自我修复进行预注册、安慰剂控制的评估

Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models

模型评测评测方法与指标

摘要

冻结的小代码 LLM 部署在本地,但在自我修复文献中,在没有安慰剂对照的情况下,仍然可以测量在尝试失败后指导重试的信息。我们将失败的程序视为猜想,将执行反例视为与预言相关的反驳,并引入 PoPE(波普尔安慰剂控制评估):一种用于衡量伪造 LLM 生成代码的证据是否可以由同一模型操作使用的方法。在 PoPE 中,错误内容与特定通道的安慰剂配对,这些安慰剂保留预先声明的支架,同时消除任务相关内容或打乱任务错误分配。冻结的小代码模型(0.5-1.5B)通过提示通道和权重通道(小数据适配器训练)根据预先注册的规则进行评估,每个臂单元对有四代。在提示频道中,公共层筛选解锁了内容消除形式安慰剂下的 12 个单元,而在 40 个单元抵抗带上的实时错误模式臂下解锁了 10 个单元;结果被记录为机制无效。在权重通道中,在错误内容适配器和无干预基线之间观察到 8-8 的平局 (p=1.0),而 SHA 混乱的安慰剂适配器以 10 次解锁保持领先;内容归因的优越性尚未得到证实。这些结果并不构成等效性或非劣效性的证据。没有单独测试等效性。调查结果仅限于公共层筛查端点;隐藏层确认是按设计推迟的。我们将其解读为,并不是编译好的批评随着信息而消失,而是因为它在测试新猜想时失去了外部作用:当从预言中学到的表示被写回生成状态时,测试被调节所取代。没有声称可以工作的 JEPA-RL 控制器。 PoPE 是一种安慰剂对照、可重新测试的测量标准。