论文

生成对抗循环

Generative Adversarial Loops

智能体系统模型推理推理加速Agent 协作智能体自我改进

摘要

人工智能研究进展可以被视为两个过程之间的相互作用:基准创建和方法发现。从历史上看,两者都是由人类智慧驱动的。然而,人工智能的最新进展加速了自动化方法发现,而自动化基准创建却受到相对较少的关注。为了实现自我推进系统,我们提出了生成对抗循环(GAL),这是一个在两个 agentic 搜索之间交替的生成器-鉴别器框架:(1)生成对抗性数据以暴露当前系统弱点的鉴别器,以及(2)发现克服这些弱点的算法的生成器。我们将该框架应用于近似算法以进行有效的推理。与主要关注算法发现的现有自动研究系统不同,GAL 引入了一个鉴别器代理,它通过不断搜索当前算法中的弱点来自动设置球门柱。我们演示了跨四个任务的对抗性数据生成:KV 压缩、稀疏视频生成、稀疏注意力和上下文扩展,其中 鉴别器识别最先进技术的弱点。我们进一步表明,GAL 能够实现自主改进,新发现的算法不仅可以改进对抗性生成的数据,还可以改进已建立的基准。具体来说,GAL 使用 Qwen3-4B 将 CompactorPress 的 KV 压缩提高了 4 倍,将鉴别器数据集的性能从 0.35 提高到 0.97,同时也优于 RULER-HARD(+0.77 分)。对于上下文扩展,GAL 在判别器数据集上将双块注意力从 0.20 提高到 0.90,同时在标准基准测试(科幻小说 (+6 分) 和 PG19 32K (-0.33 PPL))上产生收益。因此,GAL 提供了一条实现自主球门柱设置和算法改进的途径,其中人工智能系统不断发现自己的弱点并开发克服它们的方法。