论文
使用塔吉克语网络语料库对 大语言模型 的参数高效 微调 进行基准测试,用于低资源塔吉克语文本生成
Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus
摘要
我们发布了塔吉克语网络语料库(319k 文档,1.11B 字符)和基准生成器 LLM,以塔吉克语(一种低资源西里尔文脚本语言)进行即时延续。根据三种 微调 策略评估跨 9 种架构的 17 种配置:完整的 微调、LoRA 和 QLoRA(排名 8 和 16)。由于具有不同分词器的模型系列之间的困惑度无法直接比较,因此生成质量是通过每个系列内解释的困惑度来评估的,并辅以塔吉克语母语人士执行的定性分析。计算成本通过 GPU 内存和训练时间来衡量。 Mistral 7B 实现了最佳质量成本权衡,QLoRA 排名为 8:困惑度 5.11(在其分词器系列中)、由母语人士确认的连贯塔吉克语输出、14.21 GB GPU 内存以及大约 33 分钟的训练。将排名提高到 16 对 Mistral 产生的改进可以忽略不计(困惑度 5.03,成对 p > 0.05),同时消耗约 1 GB 的内存。小型 GPT-2 模型的完整 微调 获得较低的数字困惑,但会导致灾难性的遗忘(英语或乱码输出);相比之下,QLoRA 保留了多语言预训练知识并生成有意义的塔吉克语文本。仅编码器模型表现最差(困惑度约为 59),证实它们不适合自回归生成。据我们所知,这是第一个用于塔吉克语文本生成的系统 PEFT 基准测试。实际建议包括使用 QLoRA r=8 的 Mistral 7B、避免小型 GPT-2 模型的完整 微调,以及采用已发布的语料库和基准。