论文

OmniPhys:知识图驱动的基准测试和文本到图像生成中物理常识的集体优化

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

模型评测基准与评测资源

摘要

虽然文本到图像模型表现出卓越的视觉保真度,但它们经常违反基本的物理常识。现有的基准通常依赖于粗粒度的描述,无法诊断对特定物理原理的掌握情况。此外,生成过程的高随机性导致当前的即时优化方法遭受梯度幻觉,优化器被短暂的视觉伪影而不是系统缺陷误导。为了应对这些挑战,我们引入了 OmniPhys,这是一个基于物理知识图谱的 1,551 个样本的严格基准测试。通过将 PhET 模拟与标准课程结合起来,OmniPhys 可操作知识到场景的管道,通过双路径验证协议执行诊断压力测试。我们进一步提出了 OmniPrompt,一个将物理对齐视为离散优化问题的迭代框架。对于每个查询,OmniPrompt 将 K 个随机图像聚合到每个查询的反馈缓冲区中。在整个训练过程中,它会在每次元策略更新之前进一步合并来自批量 B 查询的反馈,过滤种子和查询本地噪声。对 12 个代表性文本到图像模型的评估揭示了普遍的物理瓶颈。结果表明,OmniPrompt 显着增强了不同主干网之间的物理一致性,证明了我们进化的元策略的可转移性和有效性。代码和数据可在 https://github.com/zjukg/OmniPhys 获取