论文
藏于显处:从场可视化进行视觉到符号的解析解推断
Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations
摘要
从视觉观测中恢复物理场的解析解,是AI辅助科学推理中一项基础却未被充分研究的能力。我们研究二维线性稳态场的视觉到符号解析解推断(ViSA):给定场的可视化(及一阶导数)加上最少的辅助元数据,模型必须输出单个可执行的SymPy表达式,且其中的数值常数完全实例化。我们提出ViSA-R2,并将其与一个自我验证、以解为中心的思维链管线对齐,该管线遵循类似物理学家的路径:结构模式识别→解族(ansatz)假设→参数推导→一致性验证。我们还发布ViSA-Bench,一个面向VLM的合成基准,覆盖30个线性稳态场景并带有可验证的解析/符号标注,并以数值精度、表达式结构相似度与字符级准确率评估预测。采用8B开源权重的Qwen3-VL骨干,在标准化协议下,ViSA-R2优于强大的开源基线以及所评测的闭源前沿VLM。
