论文
风格多样性在无注释合成数据生成中的意义
The Significance of Style Diversity in Annotation-Free Synthetic Data Generation
摘要
生成用于意图分类的高实用性合成数据通常需要人工注释的种子数据,而这在快节奏的工业环境中通常是不可用的。在本文中,我们提出了一个合成对话生成框架,该框架完全不需要人工注释的数据,仅依赖于意图定义。我们提出的对话生成框架利用两种不同类型的主题和风格属性来提高数据多样性。此外,我们提出了两种新颖的事后风格化模型,称为 Univ 和 Exam,将 LLM 生成的合成话语转换为更加多样化的、类似人类的语言风格。为了提高数据质量,我们利用 LLM 作为法官过滤流程。工业和公共数据集上的实验结果表明,所提出的方法可实现高达使用人工注释训练数据获得的性能的 93.3%。至关重要的是,研究结果表明,对于合成数据实用性而言,风格多样性比主题多样性更重要,因为它可以防止模型学习虚假的风格相关性。此外,研究表明,在生成过程中合并样式属性比事后样式适应更有效。