论文

治理记录即监督:面向结构化工作流修复的验证器选择自训练

Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair

模型训练合成数据

摘要

机器可验证的工作流会产生治理记录,将任务契约、模型尝试、验证器决定、被接受的输出和目标来源关联起来。我们检验这些记录能否监督能力有限的模型,把偶发或昂贵的能力整合为可靠的单次执行。在全新且结构不相交的PlanBench重规划案例上,Qwen3-14B的思考模式生成了24个被独立开发的VAL验证器接受的计划。我们用这些计划训练同一检查点的非思考执行模式,不使用标准答案或更强教师。在80个尚未查看的案例上,VAL接受的计划从1个增至57个,配对比较中有56个改善、没有退步;思考模式为30个。适配器在全部案例上都满足模式要求,平均延迟约为思考模式的1/56。但单独设置的配对接口修复检验未通过。一项匹配消融实验固定源案例、52个候选、24个训练目标、模型、训练方案及随机种子,只改变目标选择方式。在160个新案例上,基础模型、按模式选择、模型自行选择及VAL选择分别产生1、55、69和102个被接受计划。VAL相较模型自选的配对净增为33个(p=0.0000019647),且两种难度分组都有改善。因此,在该实验范围内,独立的语义选择相较匹配替代方案发挥关键作用。另一项使用更强教师的Phi实验将基础Phi-4的被接受计划从2个增至51个,模式有效输出从35个增至80个。更早的合成实验验证了可教性、累积学习、构造稳健性与停止边界。结果支持针对能力有限、可由机器检验的任务使用验证器选择的监督,而不支持任意规划、企业场景有效性或无限制自我改进。