论文
移动应用评论的细粒度情感分类:大语言模型实证研究
Fine-Grained Emotion Classification from Mobile App Reviews: An Empirical Study with Large Language Models
摘要
背景:移动应用程序评论的细粒度情感分类使需求工程活动能够超越基于极性的意见挖掘,包括基于情感的问题优先级划分和面向特征的反馈分析。然而,从应用程序评论中自动细粒度的情感提取仍然没有得到充分研究。目标:本文以先前发布的注释框架和改编自 Plutchik 分类法的人类标记的基本事实为基础,研究了如何在严重类别不平衡的情况下利用 大语言模型 进行自动多标签情感分类。方法:我们比较了多标签和二进制集成公式下的仅编码器微调、跨开源和专有模型的仅解码器零和少样本提示、以及一系列不平衡缓解策略(损失重新加权、重采样、生成数据增强),以及通过内在增强效用排名选择的综合审查生成器和提示策略。结果:经过微调的编码器在基线上大幅落后于最佳解码器的几次提示(宏观 F1 0.642)(多标签:0.387;二进制集成:0.450);将最好的多标签编码器与生成数据增强和正权重损失配对,可以缩小大部分差距 (+0.204),推理延迟比解码器低三个数量级,并且在最罕见的情绪上获得最大增益,从未检测到增益高达 +0.501 F1。结论:大语言模型 使应用评论的细粒度、多标签情感分类对于需求工程管道来说是可行的,具有适度的宏观 F1,并且最佳的制定和缓解策略是 骨干模型 和制定相关的。我们发布了实验管道、合成的语料库和微调的 检查点 以进行复制和重用。