论文
StructureClaw:可追踪的 LLM 代理和结构工程工作流程的可执行基准
StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows
摘要
解决结构工程请求需要多个答案;它需要一系列相互依赖的工件:解释的需求、可计算的模型、验证记录、求解器输出、适用的工程检查和最终报告。因此,即使底层工作流程不完整、不一致或不可执行,以问答或脚本生成为中心的评估也可能会奖励流畅的输出。我们推出了 StructureClaw,一个以工件为中心的工作台,其中 LLM 代理通过受控工程技能、类型化工具、共享工件状态和本地分析后端进行操作,以及 StructureClaw-Bench,一个包含 150 个受控场景的可执行基准,涵盖标准工作流程、交互式鲁棒性和多模式结构模型重建。其可分析的标准和多模态情况需要严格的一对一结构模型匹配以及数值响应与所选分析引擎的冻结参考响应的一致性;相反,互动案件需要积极的澄清或恢复证据以及适当时的安全不执行。仅当每个固定装置所需的断言都通过时,试验才会成功。在九种文本代理配置中,仅通用执行在 87.0% 的保留结果中通过了模型工件检查,但仅实现了 22.0% 的 E2E 成功,而自动 StructureClaw 则达到了 82.9%。交互式和多模态评估进一步将语义状态一致性和可执行模型重建确定为主要的剩余瓶颈。代码和基准可在 https://github.com/structuralclaw/structuralclaw 获取。