论文

脚手架,而不是词汇?波普尔代码生成技能的受控、两层、预注册研究

Scaffold, Not Vocabulary? A Controlled, Two-Tier, Pre-Registered Study of a Popperian Code-Generation Skill

模型评测智能体系统Agent Skills模型行为与机制分析

摘要

大语言模型 越来越多地编写、审查和判断代码,快速增长的实践使他们具备了迅速的“技能”,要求模型像科学家一样进行推理。一个突出的例子告诉模型充当波普尔证伪主义者,据报道这种技能可以改进生成的代码。但这些进步几乎总是通过 LLM 作为法官来读出,这是一种记录了立场、自我偏好和风格偏见的工具。我们问:如果它看起来有帮助,那么收益是来自该技能的波普尔内容,还是来自任何脚手架强加的结构?我们预先注册了一个带有三个控件的两层消融:一个长度匹配的安慰剂、一个保留 Popperian 标头但剥离程序的仅标签支架、一个执行预言机(HumanEval+ 单元测试),以及一个词汇光环哨兵和相同模型的自我判断审核。在前沿模型(Claude Sonnet 4.6,N=163)上,所有条件都位于基准上限附近并且不会分离,因此不支持预先注册的+5点改进(上限限制的不检测)。在小型模型(Qwen2.5-Coder-0.5B,N=164)上,结构化手臂将八局最佳正确率提高了 20-22 分,但完整技能与仅标签支架(总计 F@8=L@8 与 V@8=34.8%)相比没有显示出可分离的优势,而安慰剂仅落后 2.4 分。应用 Popperian 规则的 0.5B 自我判断无法击败随机选择,并且将 60% 的选择集中在一个指数上。在测试的两个设置中,除了仅标签支架之外,该技能的 Popperian 程序内容没有添加任何可分离的执行正确性优势,因此增益跟踪支架结构。我们提供校准后的阴性结果和可重复使用的消歧协议;这一发现限制了关于一个即时技能系列的工程主张,并不是对波普尔方法论的一般评估。