论文
BanglaRhet:孟加拉语修辞与说服识别的预训练模型基准
BanglaRhet: Benchmarking Classical and Transformer Models for Rhetorical and Persuasion Detection in Bangla Political Speech
摘要
政治话语经常使用修辞和说服性语言来构建叙事、影响公众舆论并动员受众。虽然孟加拉语自然语言处理在情感分析和意见挖掘方面取得了进展,但用于孟加拉语政治演讲中细粒度修辞和说服技术检测的Transformer模型的系统基准测试仍然很大程度上尚未得到充分探索。本文提出了基于Transformer的模型的基准研究,用于检测孟加拉政治话语中的修辞形式和说服意图。使用 BanglaRhet(从公开的政治新闻来源收集的 30,289 个孟加拉语政治演讲片段的手动注释语料库),我们制定了两个有监督的单标签分类任务:修辞技巧检测(对比、重复、夸张、隐喻、反问句)和说服技巧检测(指责分配、号召性用语、团结号召、道德、情感和逻辑诉求)。我们根据经典 TF-IDF 基线评估了四种基于 Transformer 的模型:BanglaBERT、BanglaBERT-Base、SahajBERT 和 XLM-RoBERTa-Base。 BanglaBERT 实现了最高的性能,修辞技术检测的宏 F1 为 65.40%,说服技术检测为 66.46%,分别比最佳调整的经典基线高 19.2 和 13.8 点。类别层面的分析表明,错误主要与标签之间的语义重叠、比喻语言和类别不平衡有关。结果为孟加拉语修辞和说服意识政治话语分析提供了初步基准基线,并强调了上下文感知和多标签建模的必要性。