论文

VeriGround:核验视觉依据以生成可靠的电路 Verilog 代码

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

模型训练偏好优化

摘要

多模态 大语言模型 (MLLM) 越来越多地用于将视觉工件转换为代码,从 UI 模型转换为 HTML,到科学绘图转换为 Python 脚本。电路图可以被视为硬件的可视化领域特定语言:它对时序、拓扑和位级语义进行编码,这些语义对于临时检查来说是不可见的,但一旦在硅中制造出来,安全性就至关重要。因此,将此类图转换为寄存器传输级(RTL)代码代表了视觉到代码生成的极端可靠性测试。我们揭示了一种称为 Mirage 的现象:用空白图像替换电路图使 Pass@k 保持不变甚至更高,因为模型绕过了视觉输入,而是利用模块头中的标识符语义来检索规范的 RTL 模板。这构成了人工智能辅助代码生成中的一类新的、高度隐蔽的缺陷,直接破坏了 MLLM 的可信度。为了量化效果,我们构建了 C2VEVAL 并在配对的正常/匿名协议下评估八个 MLLM,其中匿名模式匿名了图表和模块头中的所有标识符;所有模型的匿名模式得分都急剧下降,这证实了正常模式的高准确度在很大程度上是幻影。然后,我们提出 VeriGround (4B),通过标识符匿名化、拒绝增强和 D-ORPO(以决策为中心的 ORPO)偏好对齐进行训练,以提高关键生成或拒绝词元的权重。 VeriGround 的功能通过@1 为 46.11%/42.51%(正常/匿名),错误拒绝率仅为 1.20%/0.00%,同时在空白图像上保持 >92% 的拒绝率。仅使用 4B 参数,VeriGround 在 Normal 下的表现与 GPT-5.4 相当,并且显着优于 Anony 下的所有基线,证实了真正的视觉基础。