论文
EduPluginBench:人工智能生成的教育插件的可执行保证
EduPluginBench: Executable Assurance for AI-Generated Educational Plugins
摘要
代码生成模型可以生成可执行组件,但编译和功能测试无法建立对最小特权、遥测同意、出处、特权写入权限、生命周期约束或有限故障的合规性。我们引入了 EduPluginBench,这是一种可执行基准测试和分阶段准入方法,用于受控软件生态系统中生成的插件。在来自 30 个规格的 1,440 个经过激活检查的一级突变体中,P0-P4 比 P0-P2 增加了释放阻断缺陷召回率 74.7 个百分点(规格聚类 95% CI 73.4-75.8),并且在 120 个干净参考中没有观察到排斥(95% Wilson 上限 3.1%)。对两种当前编码模型的 600 个未修改代进行的冷冻转移研究发现,300/600 代已解析,但没有一个通过 P0 或达到 P0-P4 一致性(95% 上限 0.64%);下游保证估计值未定义。一项独立标记的 Moodle 研究保留了 16 个脆弱/固定对;冻结的通用 PHP 检测器没有发现有漏洞的修订。这些负转移结果阻止受控合同一致性被解读为独立的实际缺陷有效性。早期的 540 代诊断发现事后有界修复产生了 112 个 P0 通过,全部不合格,召回率从 13.4% 增加到 100%。该工件保留协议、公共源出处、原始生成、行级决策、审计、分析代码和复制指令。