论文
SimuVerity:工程级Simulink生成基准
SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation
摘要
现有Simulink基准主要评估生成模型能否编译、执行或与参考模型相似,这些标准无法确立模型是否满足工程需求。我们提出SimuVerity,横跨十个工程领域的101个文本到可执行Simulink模型生成任务基准。每个任务由可执行系统画像锚定工程规范及四类原生仿真场景;分层评估器先检查产物交付、原生可执行性与工程合格性,再对合格模型按准确率、输出质量、机理保真、控制与因果完整性、运行域鲁棒性与动态响应六个维度打分。我们用SimuVerity评估六个智能体系统,最佳系统总分仅42.86。结果表明结构相似度是工程性能的很差代理:能力瓶颈既出现在产出合格实现,也出现在合格后满足多维需求;部分高分模型仍存在严重的视觉布局紊乱。SimuVerity为评估智能体工程能力、诊断可执行Simulink生成失败提供了系统基础。