论文
PACE-Bench:在动态环境中通过代码演化评测物理自适应
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
摘要
自进化智能体从交互经验中改进未来行为,但现有评估通常在固定执行条件下优化,不测试条件变化后的恢复。为填补这一空白,我们提出PACE-Bench(Physics Adaptation via Code Evolution),一个以模拟器为基础的基准,包含横跨六个物理领域的144个源到目标适配对。每一对将源环境与具有相同目标和接口的变异目标环境关联起来。在源环境中成功的代码驱动设计在目标环境中会失败,智能体必须在有限的尝试预算内,利用诊断沙箱反馈将其迭代适配为可运行的目标设计。我们比较了来自四种范式的十种自进化方法。该基准远未饱和:Reflexion + Qwen3-14B在完整基准对上仅成功35.9%,而GPT-5.5在全预算下解决Statics子集的66.7%。这些结果共同表明,基于模拟器的反思比未经核实的自我修订更可靠,而记忆会把智能体锚定在早期设计上,宽泛的树搜索则探索而不收敛。即使揭示确切的物理变化也无法提高性能上限,这指向机制重设计而非参数推断才是核心瓶颈。数据与代码发布于 https://github.com/thunlp/PACE-Bench。
