论文

基于教育方面的情感分析的受控综合基准

A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis

模型评测基准与评测资源

摘要

基于教育方面的情感分析 (ABSA) 可以支持课程改进,但带有公共方面标签的学生反馈仍然很少,因为教育评论是私人的、针对机构的,而且注释成本高昂。本研究引入了教育 ABSA 的受控综合基准,该基准由 10,000 个综合课程评论构建,具有明确的训练-验证-测试划分以及涵盖教学质量、评估和课程管理、学习需求、学习环境和参与度的 20 个方面的教学模式。该语料库是通过采样的目标标签、采样的细微差别属性以及通过三周期法官-编辑程序完善的现实主义提示生成的。在最终的基准测试中,使用 TF-IDF、两步 Transformer 和联合编码器的本地基线表明该任务并不简单;最强的未调整模型 BERT 达到了 0.2760 的保留检测微 F1,而适度较低速率的 BERT 计划将其提高到 0.2930。使用 gpt-5.2 进行的全面测试基于 GPT 的推理在零样本模式下达到 0.2519 micro-F1,在基于检索的少样本提示下达到 0.2501,将批量推理置于经典基线之上并接近紧凑联合编码器。对 Herath 等人的 2,829 条学生反馈评论进行了保守的外部评估。 BERT 在 9 方面重叠上的 micro-F1 为 0.4593,表明部分合成到真实的迁移。 Realism 和 忠实性 分析被报告为生成器诊断,阐明基准如何稳定以及标签噪声仍然存在。因此,该研究为公共标记数据仍然难以获得的领域提供了一个综合教育 ABSA 语料库、一个记录的生成程序和一个可重复的基准设置。