论文
信息密度对用户生成内容命名实体识别的影响机制及优化研究
A Mechanism and Optimization Study on the Impact of Information Density on User-Generated Content Named Entity Recognition
摘要
在干净、高资源语料库上训练的命名实体识别 (NER) 模型在部署在嘈杂、稀疏的用户生成内容 (UGC)(例如社交媒体)上时会表现出灾难性的性能崩溃。之前的研究主要集中在逐点症状修复上——采用定制的 微调 来解决新词、别名漂移、非标准正字法、长尾实体和类别不平衡等问题。然而,这些改进往往无法推广,因为它们忽视了 UGC 固有的结构稀疏性。这项研究揭示了表面噪声症状有一个共同的根本原因:信息密度(ID)低。通过分层混杂控制重采样实验(具体控制实体稀有性和注释一致性),本文将 ID 确定为独立关键因素。我们引入注意力谱分析 (ASA) 来量化 ID 减少如何导致“注意力迟钝”,最终降低 NER 性能。根据这些机制见解,我们提出了窗口感知优化模块(WOM),这是一个 LLM 授权的、与模型无关的框架。 WOM 识别信息稀疏区域,并利用选择性反向翻译来定向增强语义密度,而无需改变模型架构。 WOM 部署在标准 UGC 数据集(WNUT2017、Twitter-NER、WNUT2016)上的主流架构上,产生高达 4.5% 的绝对 F1 改进,展示了稳健性并在 WNUT2017 上实现了新的最先进 (SOTA) 结果。