论文
TrustLDM:语言扩散模型中的可信度基准测试
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
摘要
语言扩散模型(LDM)的快速发展挑战了自回归竞争者在语言处理领域的主导地位。然而,它们灵活的任意顺序解码策略不仅可以实现快速解码,而且还可能带来新的可信度挑战。为了更好地了解其管道背后的风险,我们引入了针对 LDM (TrustLDM) 量身定制的全面可信度基准,通过多种类别的静态帖子上下文评估不同 LDM 架构的安全性、隐私性和公平性。我们的实证结果表明,虽然 LDM 通常仅在用户提示的情况下表现出很强的可信度,但当恶意帖子上下文附加到屏蔽响应时,它们的对齐行为会显着降低。我们进一步观察到,较长的上下文不一定会产生更强的效果,并且解码顺序和生成长度都会影响评估结果。最后,我们提出了 TrustLDM-Auto,这是一种自动评估框架,利用 LDM 解码灵活性来系统地识别易受攻击的配置,揭示所有评估模型和维度的重大可信度弱点。我们的工作可能会帮助社区建立更值得信赖的 LDM。我们的代码可在 https://github.com/PKU-ML/TrustLDM 获取。