论文

PhysAgent:通过基于轨迹的多智能体反馈实现基于物理的 4D 合成自动化

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

智能体系统Agent 协作

摘要

实现完全自动化、物理上合理的 3D 运动合成是图形和生成 AI 的核心目标。然而,复杂环境力场的配置仍然完全依赖于专家的手动干预,为大规模仿真数据生成带来了严重的瓶颈。现有的自动化方法主要关注材料优化,当应用于更加复杂的力场优化空间时,会表现出严重的模态差距和技术缺陷:朴素的 大语言模型 (LLM) 缺乏底层模拟反馈,导致严重的物理不准确,而传统的评分 蒸馏 采样 (SDS) 则存在梯度缓慢、局部最优陷入以及数学上无法动态切换的问题。离散力场。为了解决这个问题,我们提出了 PhysAgent,这是第一个模拟器在环多智能体框架,它利用多模态输入进行自动化、基于物理的 4D 合成。通过将内在材料与外在动力学解耦,PhysAgent 利用配备了外部力场技能模块的语义代理来掌握模拟规则并生成有效的初始化。随后,由基于轨迹的多智能体反馈驱动的优化智能体利用视觉基础模型从渲染帧中提取密集点轨迹。通过将这些显式运动轨迹转换为结构化文本描述符,代理利用 LLM 常识推理来执行零样本宏观跳跃,有效地逃避局部最优并动态切换离散力场。大量实验表明,PhysAgent 可根据任意多模态提示快速生成稳定、多样化的物理场景,在生成多样性和物理准确性方面均显着优于现有基线。