论文

K-OPSD:AEC 绘图上训练后视觉语言模型的可验证策略自蒸馏

K-OPSD: Verifiable On-Policy Self-Distillation for Post-Training Vision-Language Models on AEC Drawings

摘要

对于一般的多模态大语言模型 (MLLM) 和视觉语言模型 (VLM) 来说,解释建筑、工程和施工 (AEC) 图纸很困难。我们引入 K-OPSD,这是一种用于提高 AEC 绘图理解的 VLM 后训练方法。基于具有可验证监督的策略自蒸馏 (OPSD),我们从模型自己的 N 代最佳生成中构建了一个教师,并由流程级验证者进行了认证,并通过在暴露已验证答案的提示下重新采样来挽救失败的提示。然后,我们通过使用交叉熵内部损失对经过验证的完成进行训练来执行策略模型更新,其性能优于策略蒸馏所使用的有界标记广义 Jensen-Shannon 散度(JSD)。使用 K-OPSD,我们在 AECV-Bench 数据集上微调 Qwen3-VL 模型。由此产生的模型获得了最高的平均评判分数 (0.819) 和综合准确度 (0.738),与开源基线模型相比取得了有竞争力的结果。该配方转移到域外 ArchCAD 数据集,其中 8B 模型获益最多。我们提出了验证器套件以及持续学习和自我改进的管道,我们的结果提供了初步证据,表明验证器引导的自蒸馏是实现更可靠的机器阅读建筑图纸的有前途的途径。