论文

PhyDrawGen:从自然语言生成物理锚定的示意图

PhyDrawGen: Physically Grounded Diagram Generation from Natural Language

应用与实践内容创作

摘要

从文本生成物理示意图需要严格遵守物理定律。尽管当前的生成模型能产生视觉上合理的输出,它们会系统性地幻觉出力向量、忽略守恒定律并违反几何约束。我们提出PhyDrawGen,一个将语义场景理解与物理约束满足解耦的神经符号流水线。首先,大语言模型从题目文本中提取类型化场景图。随后,确定性求解器将该图转换为平面直线图(PSLG),把力平衡、光路与场拓扑编码为精确的几何图元。最后,一个微调的Qwen-VL模型实现视觉锚定的提出-验证循环,迭代纠正任何约束违反。在涵盖力学、光学与电磁学的1,449个问题的基准上评估,PhyDrawGen显著优于GPT-5-image、Gemini 2.5 Flash与Gemini 3 Pro,即使在异常物体问题上也展现出稳健的物理准确性。

PhyDrawGen:从自然语言生成物理锚定的示意图:论文配图
图 1:PhyDrawGen 的整体流程。为了弥合语义理解和代数精确性,语言模型 (GPT-4o) 从文本(左框)中提取类型化的场景图。求解器将其转换为强制执行物理图元的平面直线图(中间框),而 Qwen-VL 循环则在渲染之前迭代​​地纠正违规行为。