论文

知识应该从哪里进入?多模态生成中知识注入的分层框架

Where Should Knowledge Enter? A Layered Framework for Knowledge Infusion in Multimodal Iterative Generative Model

上下文与知识知识获取与更新

摘要

多模态生成模型可以产生流畅的输出,但当生成必须尊重结构化、特定领域或安全关键知识时,它仍然不可靠。现有的方法通过即时增强、指导、潜在编辑或微调等机制整合知识,但它们通常按技术而不是按它们修改的生成过程的组成部分进行分类。我们认为迭代生成模型中的知识注入从根本上来说是一个干预层问题。由于生成过程作为内部状态的轨迹展开,因此知识可以作用于该过程的四个结构上不同的组成部分:输入/输出边界、转换函数、中间状态和模型参数。这映射到四个干预层:表面、轨迹、潜在和参数注入。我们在扩散模型中实例化框架,将代表性方法映射到所有四个层,并导出多层组合的设计原则。在使用具有两个扩散主干的多模态知识图的受控安全对准实验中,我们累积地实现了四层中的三层:表面(输入侧和输出侧)和轨迹-潜在(中期生成)。我们凭经验证明,每个附加层都解决了先前层无法达到的故障类别,与普通生成相比,将违反知识的输出减少了 70.97%,并凭经验证实了框架的互补性预测。

知识应该从哪里进入?多模态生成中知识注入的分层框架:论文配图
图 1:迭代生成模型中知识注入的四个干预层。外部知识作用于生成轨迹的四个结构上不同的组成部分:表面(输入/输出边界)、轨迹(转换规则 fθf_{\theta})、潜在(中间状态 hth_{t})和参数(模型权重 θ\theta)。这使得能够补充覆盖即时级别、结构性和分布性违规行为。