论文

一张图像即可满足您的需求:通过基于文本的世界模型生成代理单次图像以实现长尾空间感知

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

模型训练合成数据

摘要

可靠的空间决策自动化,例如自动驾驶和海上监视,很大程度上取决于强大的视觉感知。然而,现实世界的时空数据表现出严重的异质性,通常表现为安全关键场景的极端长尾分布。这种数据稀缺会导致数据集转移,从而降低检测性能并带来安全风险。虽然合成数据生成提供了一种潜在的解决方案,但现有的生成方法,例如扩散模型和生成对抗网络(GAN),通常缺乏明确的空间定位和结构约束,导致生成的场景在空间和物理上不一致。为了应对这些挑战,我们引入了 WMGen-v1,这是一种用于长尾空间数据生成的基于代理文本的世界模型框架。 WMGen-v1 采用大型视觉语言模型 (LVLM) 从单个参考图像构建结构化场景表示,而 大语言模型 (LLM) 在物理合理性和常识约束下执行基于指导的场景扩展。随后,以推理过程产生的结构化语义表示为条件,扩散模型生成多样化且基于物理的长尾训练数据。对内部工业数据集、ROADWork 和 LaRS 基准的实验表明,WMGen-v1 的性能优于基线方法。值得注意的是,仅在 WMGen-v1 合成数据上训练的检测器在聚合数据集级别指标上接近真实性能,突显了其缓解下游空间感知长尾数据稀缺性的潜力。