论文
WorldFact-Bench:超越图像内部合理性到图像世界一致性
WorldFact-Bench: Beyond Image-Internal Plausibility to Image-World Consistency
摘要
图像生成的进步使得视觉真实性变得越来越难以评估。尽管图像取证现在可以检查生成伪影和更高级别的视觉不一致,但看似合理的图像仍然可能与现实世界的事实或规则相矛盾。我们引入 WorldFact-Bench 来评估单个图像的图像世界一致性,无需预定义的声明或验证目标。该基准测试包含 1,274 个源对齐的真假对,跨越四种验证机制和十个语义域。每对都引入了具体的、有证据支持的事实冲突,同时寻求保留非目标内容和视觉合理性。图像是独立评估的,成对精度要求对成对的两个成员都进行正确分类。我们进一步提出 PERSIST-Agent,它围绕连接候选事实、视觉观察、证据和验证状态的持久状态组织迭代验证。该状态指导后续检查和检索,同时保留未解决的候选者。脊柱重量固定后,Harness 自我优化通过验证反馈细化代理的提示和执行规则。实验揭示了多个检测器中存在强烈的标签偏差以及检索带来的不均匀收益。在评估的 8B 主干上,PERSIST-Agent 提高了直接判断和检索增强基线的配对准确性,而消融则支持持久验证状态的作用。这些发现凸显了国家指导验证的价值以及视觉合理性和事实正确性之间仍然存在的差距。