论文
通过 蒸馏 和合成数据进行高效的金融语言理解
Efficient Financial Language Understanding via Distillation with Synthetic Data
摘要
大型指令跟踪模型功能强大,但部署成本高昂,特别是在金融领域,标记数据受到机密性和专家注释成本的限制。我们通过 蒸馏 和合成数据提出了一个有效的金融情绪分析框架,将知识从大型指令调整教师转移到紧凑的学生模型。该框架是针对资源匮乏的条件而设计的,其中手工收集并标记了一小部分真实示例。然后,该框架对示例进行聚类,并使用聚类来选择种子,以通过结构化的少样本提示生成合成示例。实验表明,基于聚类的种子选择比随机采样产生更具代表性的合成数据,使紧凑模型能够以最少的监督实现强大的性能。值得注意的是,在更复杂和嘈杂的文本领域,在完整的合成种子语料库上训练的紧凑模型甚至优于教师模型,同时在正式文本上保持竞争力。该框架提供了一条以最少的人工标记工作实现金融 NLP 领域资源高效领域适应的实用途径。