论文
CHASM:在中国社交媒体上揭露隐蔽广告
CHASM: Unveiling Covert Advertisements on Chinese Social Media
摘要
目前在社交媒体审核中评估 大语言模型 (LLM) 的基准完全忽视了一个严重的威胁:隐蔽广告,这些广告伪装成常规帖子来欺骗和误导消费者进行购买,从而导致重大的道德和法律问题。在本文中,我们提出了 CHASM,这是一个首个数据集,旨在评估多模态 大语言模型 (MLLM) 检测社交媒体上隐蔽广告的能力。 CHASM 是一个高质量、匿名、手动整理的数据集,由 4,992 个实例组成,基于中国社交媒体平台 Rednote 的真实场景。该数据集是在严格的隐私保护和质量控制协议下收集和注释的。它包含许多与隐蔽广告非常相似的产品经验分享帖子,使得数据集特别具有挑战性。结果表明,在零样本和上下文学习设置下,当前的 MLLM 都不足以可靠地检测隐蔽广告。我们进一步的实验表明,微调 开源 MLLM 在我们的数据集上产生了显着的性能提升。然而,重大挑战仍然存在,例如检测评论中的微妙线索以及视觉和文本结构的差异。我们提供深入的错误分析并概述未来的研究方向。我们希望我们的研究能够呼吁研究界和平台管理员针对这一新兴威胁制定更精确的防御措施。