论文
PhysCodeBench:通过自我校正多智能体细化对 3D 场景的物理感知符号模拟进行基准测试
PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement
摘要
将物理现象的自然语言描述转换为可执行的模拟代码需要编程专业知识和物理推理。当前的 大语言模型 (LLM) 缺乏这种组合:它们经常生成运行但模拟错误物理的代码。我们推出了 PhysCodeBench,这是该任务的第一个基准测试,其中包含跨越四个物理领域的 1,200 个经过专家验证的示例。其评估套件 PhysCodeEval 超越了可执行性和视觉保真度,通过守恒定律残差和专家编写的断言直接从引擎状态测量物理正确性,并支持跨引擎评估,将物理推理与 API 流畅性分开。作为参考方法,我们提出了自校正多代理细化框架(SMRF),它通过专门的代理将物理感知纠错与代码生成解耦。这种设计的动机是我们发现有针对性的校正,而不是一般的迭代细化,是物理精度的关键驱动因素。 SMRF 几乎是最佳专有基线的物理断言通过率的三倍(70.6\% vs.\ 23.8\%),并在跨引擎传输下保留了其优势。