论文

低资源语言中的意识形态立场检测:孟加拉国公立大学与私立大学社交媒体话语中的两极分化

Ideological Stance Detection in a Low-Resource Language: Polarization in Bangladeshi Public vs Private University Discourse on Social Media

应用与实践结构化分析、预测与决策

摘要

公立大学与私立大学是一个有争议的问题,它在孟加拉国的社交媒体上造成了两极分化。关于质量、工作和声望的争论在学生、家长和毕业生中展开,其中大多数人讲孟加拉语,这是一种资源匮乏的语言。为了衡量这种两极分化,本文引入了一个手动注释的数据集,其中包含 4,060 条孟加拉语评论,标记为支持公共、支持私人或中立。我们通过 Fleiss 的 Kappa 一致性评估了注释的质量,该一致性为 0.89,这对应于注释者之间的高度一致性。评估了经典的 ML(SVM、随机森林、XGBoost)、BiLSTM 网络、混合 BanglaBERT+XGBoost 模型和最先进的零样本LLM(Claude Sonnet 4、DeepSeek-V3.1、Llama 4 Maverick、Kimi K2 Thinking、Qwen3-235B Thinking)模型。 BanglaBERT+XGBoost 的准确率为 91.81%,宏 F1 得分为 91.70%,高于所有监督基线。零样本 Llama 4 Maverick Thinking 在没有任何微调的情况下实现了 0.931 的宏观 F1(总体精度为 93.31%)。所有机器学习 (ML)、深度机器学习 (DL) 和 Transformer 模型的性能均优于零样本 Llama 4 Maverick 模型。两极分化也很明显,在某些方面,支持私人的评论强调现代化设施和及时毕业,而支持公共的评论则强调负担能力和政府工作,两极分化更加明显。我们的研究结果为分析低资源语言的社交媒体两极分化开辟了新的方向。

低资源语言中的意识形态立场检测:孟加拉国公立大学与私立大学社交媒体话语中的两极分化的原论文方法或结果图
图 1:BDA 框架的增强技术示例