论文

Vibe 编码是未来吗? LLM 生成的建筑安全规范的实证评估

Is Vibe Coding the Future? An Empirical Assessment of LLM Generated Codes for Construction Safety

模型评测鲁棒性、公平性与可信度评测

摘要

vivi 编码是一种非技术用户指示 大语言模型 (LLM) 通过自然语言生成可执行代码的范例,它的出现为建筑行业带来了重大机遇和严重风险。在授权安全经理、工头和工人等施工人员开发工具和软件的同时,LLM 的概率性质引入了无声故障的威胁,其中生成的代码可以完美编译,但执行有缺陷的数学安全逻辑。本研究实证评估了由三个前沿模型(Claude 3.5 Haiku、GPT-4o-Mini 和 Gemini 2.5 Flash)生成的 450 个 vivi 编码 Python 脚本的可靠性、软件架构和特定领域的安全保真度。该研究利用角色驱动的提示数据集 (n=150) 和由隔离动态沙箱和 LLM-as-a-Judge 组成的分叉评估管道,量化了零样本振动代码对建筑安全的严格限制。研究结果揭示了用户角色和数据幻觉之间存在高度显着的关系,表明不太正式的提示会大大增加人工智能发明缺失的安全变量的倾向。此外,虽然模型表现出较高的基础执行可行性(~85%),但这种语法可靠性主动掩盖了逻辑缺陷和防御性编程的严重缺乏。在成功执行的脚本中,该研究发现总体静默故障率高达约 45%,令人震惊,而 GPT-4o-Mini 在其功能代码的约 56% 中生成数学上不准确的输出。结果表明,当前的 LLM 缺乏独立安全工程所需的确定性严格性,因此需要采用确定性 AI 包装器并对网络物理部署进行严格治理。