论文
AEC-Bench:面向建筑、工程与施工领域智能体系统的多模态基准
AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
摘要
AEC-Bench 是一个多模态基准,用于评估智能体系统在建筑工程施工(AEC)领域真实任务上的表现。该基准涵盖需要图纸理解、跨图纸页推理以及施工项目级协调的任务。本报告介绍该基准的动机、数据集分类体系、评估协议,以及在若干领域专用基础模型执行框架(harness)上的基线结果。我们利用 AEC-Bench 识别出能在其各自基础 harness(如 Claude Code 与 Codex)中一致提升各基础模型表现的工具与 harness 设计技巧。我们以 Apache 2 许可证在 https://github.com/nomic-ai/aec-bench 公开发布基准数据集、智能体 harness 与评估代码,以实现完全可复现。