论文
无需训练 用于 2D 结构框架计划中结构部件检测的代理计算机视觉
Training-Free Agentic Computer Vision for Structural Component Detection in 2D Structural Framing Plans
摘要
将结构框架计划转换为可编辑的有限元模型草稿是一项劳动密集型工作,并且容易出现转录错误。现有的建筑构件识别系统通常依赖于特定任务的神经检测器,而结构工程中的语言模型代理通常对文本或模型数据而不是图纸进行操作。据作者所知,这项工作首次将代理视觉语言层应用于框架计划 PDF 的结构组件检测和模型起草,而无需特定任务的检测器训练或 微调。确定性阶段提取几何基元,通过尺寸比一致估计比例,使用显式绘图语法识别五个实体类,并组装可编辑布局。代理阶段通过确定性候选、特定于操作的准入测试、变更级别审查和失败关闭事务来限制类型更正。评估使用作者生成的 100 个计划基准,平均分配用于所有规则修订的开发一半和规则冻结并评估一次后生成的种子不相交的保留一半。所有分数都是保留一半的完整框架的端到端结果。每张图纸的比例估计值与发电机参考值的误差均在 0.1% 以内。柱的召回率和精度为 0.922/0.997,梁为 0.886/0.990,墙为 1.000/1.000,支撑为 1.000/1.000,开口为 1.000/0.964。一项对照研究在三张开发图纸上重复了两次损坏三次。校准通过了所有九项试验,而成员修复在九项试验中有五项满足了所有严格的最终状态标准。由于两个基准测试共享一个生成器,因此评估不涉及独立起草的计划、栅格输入、分析连接或求解器验证。