论文

猜猜统一模型:我们可以从生成的图像中恢复多少?

Guess the Unified Model: How Much Can We Recover from Generated Images?

模型评测模型行为与机制分析

摘要

随着统一模型生成的图像现在在网上广泛传播,归因其模型的起源提供了一条通向透明度和更深入地了解各个模型的特征行为的途径。先前的工作已经探索了 LLM 生成的文本、扩散模型图像和数据集的来源,但统一模型生成的图像的可分离性仍然是一个尚未充分探索的领域。我们通过使用七个统一模型生成的图像检查腐败、域和提示语言之间的可分离性来解决这一差距。我们证明模型归因是高度可行的,因为我们的模型在每个模型大约 20K 图像的情况下实现了近乎完美的准确性。损坏和结构扰动对归因性能的影响不大,跨域泛化表明语义内容有助于可分离性,但不是主导信号。最后,我们观察到,对于大多数模型来说,提示语言归因都在机会水平附近,这表明特定于语言的视觉特征最少。这些发现强调了统一模型输出中一致的特定于模型的视觉特征,并为跟踪和审核生成图像管道开辟了新的方向。