论文

FARE:从输出图像审计生成器是否被替换

FARE: Forensic Acceptance Region Estimation for Catching Bait-and-Switch Image Generators

AI 基础设施AI安全与内容治理基础设施

摘要

现代人工智能图像生成器越来越多地部署为不透明的 API,客户可以查询已部署的服务,但无法检查模型权重或架构。这带来了一个实际挑战:提供商可能会使用一台生成器通过治理认证,然后默默地切换到更便宜、质量较低的生成器进行部署,从而损害公众信任,甚至损害高风险领域的安全。我们研究部署时的完整性审计并提出 FARE(取证接受区域估计)。通过对从该生成器采样的图像进行 FARE 训练来注册经过认证的生成器。部署后,FARE 可以仅使用该图像来确定生成的图像是否与注册的生成器一致。 FARE 的特征基于图像生成器特定的伪影,这些伪影已被提议用于取证应用。 FARE 在训练过程中通过寻找硬样本来放大这些特征,这些样本可以收紧接受区域并提高对认证生成器中细微变化的敏感性。在生成器交换中,包括用类似模型版本和模型变体进行替换,FARE 可以有效地检测交换,在严格的操作点上始终优于现有基线,并且在本工作中评估的精确模型和仅决策攻击下仍然有效。

FARE使用认证生成器图像建立取证接受区域,再核查部署后输出是否一致。
图1(图注摘要):FARE使用认证生成器图像建立取证接受区域,再核查部署后输出是否一致。