论文

用同策略上下文蒸馏将 Agent 经验内化到扩散权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

摘要

将图像生成模型封装在 Agentic Harness 中可以有效提高文本到图像任务的性能:Harness 可以利用记忆、技能、工作流程编排、结果验证和迭代细化来不断构建和修改提示,从而得出更好的图像。然而,这些增益仍然处于扩散模型的外部,并且只有在完整的 Harness 运行时才能实现。我们提出了 Diffusion 同策略 Context Distillation (D-OPCD),它将智能体改进的提示视为特权上下文,并将智能体 Harness 中编码的知识提取到扩散模型的权重中,以便该模型在仅以原始查询为条件时保留 Harness 的部分优势。使用配备我们提出的自动技能进化器(ASE)的文本到图像智能体,我们证明 D-OPCD 可以将 Harness 功能内化到生成器的权重中,将四个基准的平均直接生成分数从 60.52 提高到 65.09。通过将这些知识吸收到权重中,Harness 可以摆脱其饱和技能并恢复进化:更新后的生成器上的第二轮 ASE 比无技能的 Harness 提高了 1.83 分,指向文本到图像系统,其中 Harness 和模型通过持续的共同进化不断相互改进。

用同策略上下文蒸馏将 Agent 经验内化到扩散权重:论文原图
图 1:方法概述。随着任务的积累,T2I Harness 会学习可重复使用的技能,从而在发电机保持固定的情况下改进其提示。 D-OPCD 在原始查询 $q_{i}$ 和 Harness 选择的提示 $p_{i}$ 上设置 EMA 教师模型,并训练仅以 $q_{i}$ 为条件的 学生模型,以匹配 教师模型 沿着 学生模型 自己的去噪轨迹的预测。更新后的生成器可以单独从 $q_{i}$ 生成,而 Harness 则重置其技能以继续适应它。