论文
情感分析中被忽视的重复延长形式
The Overlooked Repetitive Lengthening Form in Sentiment Analysis
摘要
参与在线交流的个人经常以非正式的方式(例如模因和表情符号)表达个人意见。虽然具有非正式交流的语言模型 (LM) 已被广泛讨论,但一种独特且强调的风格,即重复加长形式 (RLF),多年来一直被忽视。在本文中,我们探讨了两个研究问题的答案:1)RLF 对于情感分析(SA)重要吗? 2)LM能理解RLF吗?受先前语言研究的启发,我们策划了 \textbf{Lengthening},这是第一个包含 85 万个样本的多域数据集,专注于 SA 的 RLF。此外,我们引入了 \textbf{Exp}lainable \textbf{Instruct}ion Tuning (\textbf{ExpInstruct}),这是一个两阶段指令调整框架,旨在提高 RLF 的 LLM 的性能和可解释性。我们进一步提出了一种新颖的统一方法来量化语言模型对非正式表达的理解。我们证明 RLF 句子是富有表现力的表达方式,可以作为文档级情感的签名。此外,RLF 对于在线内容分析具有潜在价值。我们的结果表明,经过微调的预训练语言模型 (PLM) 在性能上可以超越零样本 GPT-4,但不能解释 RLF。最后,我们证明 ExpInstruct 可以改进开源 LLM,以在有限样本的 RLF 的性能和可解释性方面与零样本 GPT-4 相匹配。代码和示例数据可在 https://github.com/Tom-Owl/OverlookedRLF 获取