论文

架构师、对抗者与裁判:大规模课标对齐测评题的闭环生成

The Architect, the Adversary, and the Judge: Closed-Loop Generation of Standards-Aligned Assessment Items at Scale

模型推理推理验证与自校正

摘要

我们提出CLAIM,一个面向K-12测评题生成的生产级流水线,它耦合了“先生成后攻击”的两阶段协议(模型先以“课程架构师”身份起草,再以敌意对抗审稿人身份重入同一对话)、基于已接受与被拒绝题目的双向少样本条件化——后者携带评价器的诊断——以及一个包含44,844条纠错规则的知识词典,这些规则从上述反馈中挖掘并按课程标准与题型检索。在覆盖755条Common Core ELA课程标准、三种题型、十个LLM的43,227道已评分题目中,该流水线在9,074道题的生产运行中达到97.8%的专家评价通过率。随后我们追问这一比率究竟能证明什么:用来自其他厂商的三个裁判对分层样本进行盲评,在各裁判下都复现了题型排序,并比部署的评价器暴露出更大的开放集差距;但在生产通过率下,裁判与部署评价器在接受/拒绝二值判定上的一致性很弱(kappa约0.13),且裁判之间彼此的一致性也不更好。因此该水平是相对于裁判而言的,且由于没有学生作答数据,我们的质量证据全程来自评价器判定。语料还揭示了一个稳健的不对称性:在十余条静态规则下,两个前沿模型的选择题与多选题生成都达到98%以上的饱和;而填空题生成呈能力分层(在匹配的规则集、课标与裁判下,五个模型为82.8%—96.7%),且在仅靠提示词的优化下趋于停滞,误差重心随规则累积在答案键过度包含与遗漏之间迁移。我们把这一现象分析为开放集边界判定——自回归解码器在结构上不适合解决的任务——并展示当评价器本身被蒸馏时该不对称性再次出现:失败召回率从8%升至63%,而F1在0.25处饱和。