论文
从 Unity 模拟到基于扩散的增强:量化数据集平衡以实现稳健的对象检测
From Unity Simulation to Diffusion-Based Augmentation: Quantifying Dataset Balance for Robust Object Detection
摘要
现代计算机视觉模型在大规模带注释的数据集上进行训练时可以实现高精度。在建筑安全监控等关键领域,数据收集成本高昂、危险且受到道德约束。本文提出了一项系统研究,比较了两种互补的数据生成范例:(1) 基于 Unity 模拟的渲染和 (2) 基于可控扩散的生成 (CIA),用于真实数据稀缺条件下的对象检测。统一的实验框架可以实现真实、模拟和生成源之间的受控数据集混合,同时保持相同的模型和训练设置。使用精度、召回率、mAP 和自定义 $Δ$ 指标进行的定量评估表明,单独的模拟或生成增强都无法实现最佳可转移性。相对于真实数据,仅 Unity 训练产生的 mAP@0.5 下降 $-50\%$,而仅 CIA 训练显示较温和的 $-16.5\%$ 下降。混合组合显着提高了性能,90\% real + 10\% Unity 配置实现了 $62.68\%$ 的最佳整体 mAP@0.5(超过基线 $+7.64\%$),而 90\% real + 10\% CIA 配置最大程度提高了精度 $74.45\%$。结果表明,有限的合成包含可以增强泛化能力,而过度的取代会导致域漂移。