论文
扎根且忠实的 P&ID 推理:使用恢复的证据图约束视觉语言模型
Grounded and Faithful P&ID Reasoning: Constraining Vision-Language Models with Recovered Evidence Graphs
摘要
管道和仪表图 (P&ID) 是过程工厂的权威地图:隔离、维护和 HAZOP 决策取决于什么连接到什么。视觉语言模型可以流畅地描述这些工作表,但它们经常发明或错过流程连接,而发明或错过的链接可能会逆转隔离或可达性调用,因此工厂决策不能信任从未与线路检查过的流畅答案。相反,我们恢复绘图的显式图形(其符号、它们之间的过程连接以及命名它们的标签),然后要求模型仅通过七个只读运算符查询该图形来回答,因此仅当它引用支持它的查询结果时才返回拓扑声明。在 TopoPID-VQA(针对这些工作表的 3000 个拓扑问题的新套件)上,Graph-Grounded Harness(我们的)将 Qwen3-VL-4B、Qwen3-VL-8B 和 Gemma-4-E4B 的精确匹配精度从仅图像提示下的 36.7--41.3% 提高到 74.3--76.0%。它在不完美的基底上做到了这一点:在 Digitize-PID 数据集上,恢复的图在精确的过程连接上得分 F1 0.742,一旦符号和标签汇集在一起,得分为 0.801。残余误差跟踪差距:依据证据图推理在恢复的图正确时才能获益,而感知错误仍然破坏了拓扑问题。