论文
大语言模型去品牌:消除商业身份,同时保留通用实用性
LLM unbranding: Erasing Commercial Identity while Preserving Generic Utility
摘要
将去品牌化作为防止视觉徽标获得负面含义的关键实践是图像生成中的标准。大语言模型 (LLM) 现在面临着一个并行且新兴的挑战。这些模型经常在不同的背景下生成品牌描述。这种频率会带来重大风险,例如商标淡化、虚假归属和品牌诽谤。作为回应,我们正式定义了 LLM Unbranding 的新任务。我们专门解决在文本输出中管理商业外观的复杂挑战。这涉及中和定义品牌形象的特征语言、口号和风格标记。至关重要的是,这些元素不如明确的视觉徽标那么明显。为了对这项任务进行基准测试,我们引入了一个综合评估数据集,其中包含来自多个商业领域的知名品牌。我们使用此基准严格评估现有的最先进的机器取消学习模型。该评估确定了它们在选择性文本去品牌化方面的局限性。最后,我们提出了 MUTE,一种新颖的推理时间方法,可以有效地中和文本商业外观,同时保留大语言模型的一般功能和实用性。通过利用迭代细化循环,MUTE 系统地优化系统指令,以安全地消除品牌泄漏,而无需更新脆弱的参数。代码和数据集:LLM Unbranding 的评估数据集和代码可在 https://github.com/KajetanOzog/LLM_unbranding. 获取 MUTE 的实现可在 https://github.com/KajetanOzog/MUTE. 获取