论文

Bangla Key2Text:从低资源语言的关键字生成文本

Bangla Key2Text: Text Generation from Keywords for a Low Resource Language

模型评测基准与评测资源

摘要

本文介绍了 \textit{Bangla Key2Text},这是一个包含 260万条孟加拉语关键字文本对的大型数据集,旨在以低资源语言生成关键字驱动的文本。该数据集是使用基于 BERT 的关键字提取管道构建的,该管道应用于数百万孟加拉新闻文本,将原始文章转换为适合监督学习的结构化关键字文本对。为了在这个新基准上建立基准性能,我们微调了两个序列到序列模型 \texttt{mT5} 和 \texttt{BanglaT5},并使用多个自动指标和人工判断来评估它们。实验结果表明,与零样本 大语言模型 相比,特定于任务的 微调 显着改善了孟加拉语中关键字条件文本的生成。公开发布数据集、训练模型和代码,以支持孟加拉语自然语言生成和关键字到文本生成任务的未来研究。