超越可执行模型:用于物理系统建模的 Pufibara Agent Harness 和 Modelica Agent 工作流程基准
Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling
摘要
人工智能代理越来越多地用于模拟驱动的工程。物理系统建模提出了与软件工程中通用代码生成不同的要求,因为正确性不仅取决于语法和可执行性,还取决于物理一致性和场景相关行为。我们在 Modelica 中研究这一挑战,Modelica 是一种基于方程的建模语言,其中模型可以编译和模拟,但仍然违反其预期的物理或工程要求。在连续的修订中,代理可能会忘记需求或依赖于过时的候选者产生的模拟证据。为了应对这一挑战,我们提出了 Pufibara,这是一种代理工具,它可以在各个修订中保持持久的工程状态,将执行和模拟证据与生成它的候选证据相关联,并使提交成为显式的代理操作。为了评估端到端 Modelica 代理工作流程,我们还提出了一种基于源的方法来构建现实且可独立评估的任务。我们使用此方法构建 232 任务 Modelica Agent 工作流基准,涵盖模型修复、模型生成和模型调优。每个提交的候选人都会由代理循环之外的基准拥有的评估员进行评分。我们将 Pufibara 与 Claude Code 作为两个匹配的 大语言模型 (LLM) 后端下的完整工具进行比较。使用 DeepSeek v4 Flash,Pufibara 通过了 202 项任务,而 Claude Code 则通过了 185 项任务。在 Claude Sonnet 5 中,Pufibara 通过了 202 项任务,而 Claude Code 则通过了 187 项任务。根据存储库报告的词元核算,Pufibara 记录的逻辑词元总数降低了 76.4%-82.5%。其顺序运行时间降低了 6.1%-58.4%。这些发现表明,即使在匹配的 LLM 后端下,完整的代理工具在任务成功和物理系统建模的资源使用方面也可能存在很大差异。