论文

BEAMS:建模与仿真AI的基准测试与评估

BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation

模型评测基准与评测资源

摘要

支持现实世界决策的AI工具必须能够构建仿真模型,以便为其建议提供依据并使其可解释。能够自动化建模实践某些环节的工具必须是对人类专业知识的补充,而非取代。BEAMS计划旨在通过为以人为中心的建模与仿真实践建立基准,引导建模与仿真AI工具的发展走向负责任且合乎伦理的形态。该计划利用开放的数字化与组织化基础设施,协作评估建模与仿真领域的AI工具。由该计划托管的开源sd ai项目确立了透明性,并使贡献得以广泛共享。指导小组负责确定潜在基准的优先级,技术小组则负责以自动化测试的形式实现这些基准。针对若干不同评估类别的测试已经实现,并应用于支持定性建模、定量建模和模型讨论的AI工具。这些测试涵盖因果转译、模型迭代、因果推理、一致性(conformance)、模型行为解释、建模步骤建议和模型修复建议。当sd ai项目的引擎与不同LLM结合时,它们在这些评估上的表现揭示了不同AI工具之间的差异。该计划实施的评估表明,AI赋能的建模工具在讨论和基础定性任务上的表现优于因果推理和定量错误修复。没有任何单一LLM在所有引擎类型上占据优势,这凸显了具体任务的重要性以及速度与准确性之间的权衡。该计划的后续工作旨在纳入通过考虑替代视角和以人为中心的使用场景来回应偏见担忧的基准。