无信号选择,通过表达恢复:冻结小代码模型事后伪造算子的测量研究
Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models
摘要
冻结的小代码模型(<=1.5B 参数,无需 微调 在本地运行)适合离线和隐私受限的使用,但经常会发出看似合理但错误的程序。自然的补救措施是事后操作员选择、验证、修复或重新处理模型的样本,而无需重新训练;从原则上讲,这是波普尔式的:用严格的测试来攻击每个候选人,保留幸存下来的。我们衡量这些运算符是否有帮助。在一个确定性执行预言机和无泄漏、匹配计算协议下,根据 Best-of-N (BoN) 评估 26 个语义事后算子(选择、验证、修复、消除、组合、声音否决、生成调节);在测试的单元和基准测试中,没有一个比 BoN 更能提高保留精度。负面影响是机械性的:覆盖墙(系统性的困难任务失败,更深的采样无法挽救),能力剪刀(一个有能力的生成器在可见测试通过者中几乎没有留下可辨别的错误),以及近乎空的共识陷阱(无泄漏选择器所需的可见通过但隐藏错误的大多数很少与正确的替代方案同时出现)。除非 n>=45,否则无分布的无伤害界限无法证明观察到的伤害为零时伤害率 <=alpha。两个运算符在语义输出空间之外的不同轴上提供帮助。表达式层恢复 (M1) 是这里唯一的准确性增益,可恢复标准提取器丢弃的正确程序(稳健提取和公共测试签名对齐);它没有任何害处 (b10=0),无泄漏,并且在 HumanEval+ 上将 DeepSeek-Coder-1.3B 的任务提升了+12 (p=2.4e-4)。自适应共识提前停止 (ACE) 是一种经过校准的计算节省控制(节省约 19%,零伤害)。 M1 和选择阴性在三个模型细胞中的 HumanEval+ 和 MBPP+ 上复制。教训:在指责语义事后推理之前修复工具并测量覆盖范围。