论文
MIL-BERT:具有性能和解释性保证的任意大文本的分类
MIL-BERT: Classification of Arbitrarily Large Text with Performance and Explanatory Guarantees
摘要
许多文本分类决策仅基于成分摘录是可行的。受到多实例学习领域的启发,我们提出了一种算法,用于训练神经网络通过选择此类摘录来对文本进行分类。我们通过对近 100 万个 token 的样本进行学习,证明我们的方法也是可扩展的。我们在 7 个数据集上评估我们的方法,重点关注远远超出基本模型编码限制的长文本集合。我们使用该算法在 3 个数据集上展示了最先进的结果:识别新闻媒体中的政治偏见、触发长篇故事中的警告以及推文集合中作者的人口统计特征。此外,在弱标签文本集合(包)上训练的模型可以概括为准确地对组成的较小实例进行分类。除了解决这些问题的最新技术之外,这种方法还是在这些数据集中表现出色的少数神经方法之一。