论文
超越可教内容的搜索:在代理视觉生成中发展知识边界
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
摘要
视觉生成器擅长渲染,但他们自信地制造他们不知道的东西。用户请求是无限的、不断发展的、深度长尾的:新角色、趋势实体、截止后事件等等。这种世界知识瓶颈是结构性的:生成器是在固定语料库上训练的,但视觉世界是开放的。我们构建了 SearchGen-20K 和 SearchGen-Bench,其中包含 20,839 个提示,涵盖 12 个故障类别和 22 个领域,并与预执行的多模式 SearchGen-Corpus-1M 配对,以支持离线、可重复的研究。在 SearchGen-Bench 上,前沿开放生成器的得分仅为 21 到 28(满分 100),在现有基准测试中无法看到 40 分的下滑。自然的补救措施是使用搜索工具,实现代理视觉生成。然而,我们发现朴素搜索失败了:它不加区别地检索,将噪声注入到生成器已经处理的提示中。我们将根本原因追溯到生成器特定的、不断发展的知识边界:生成器可以通过训练内化的内容和必须保留在外部环境中的内容之间的鸿沟。尽管这个边界很难提前指定,但我们证明它可以通过先教后搜索的协同训练框架来发现。即使是这种协同训练方法的最小版本也会产生单调改进,为视觉生成中的递归自我改进奠定基础,以满足基于世界知识的要求。我们发布了完整的数据集、协同训练语料库和搜索语料库,作为工具增强、基于世界知识的视觉生成的可重播工具。