论文
想要更好的综合数据吗?引导它:低资源语言生成的激活引导
Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation
摘要
大语言模型 (LLM) 已成为合成数据生成的有效工具,包括低资源语言,其中生成的数据可以提高下游任务性能。目前表现最好的方法通常依赖于目标语言示例的少量提示,这会增加推理成本,并可能通过词汇锚定减少多样性。在这项工作中,我们研究了激活引导作为低资源合成数据生成的替代方案。我们研究两种指导策略:语言指导,其目标是语言的语言特性;质量指导,通过对比人类编写的文本表示和反向翻译的文本表示来捕获格式良好的情况。我们通过生成情感和主题分类数据并微调较小的分类器,在四种开源 LLM、多层和 11 种类型不同的语言中评估这些方法。转向适用于零射击和少射击提示设置,并与非转向对应物进行比较。我们的结果表明,对早期层的控制持续提高了生成数据的多样性,同时通常会产生更强的下游模型性能,特别是对于低资源语言。