论文

以小搏大:用于可验证多项选择任务的小型语言模型 (TLM) 的分类头 微调

Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks

模型训练参数高效训练

摘要

我们将微型语言模型 (TLM) 定义为低于大约 3B 参数、适合主流消费设备的模型。我们研究如何使它们适应并用于可验证的多项选择任务。我们在多个 Qwen3 模型(从 0.6B 到 8B)的统一设置上比较了三种基于 LoRA 的 微调 范式(标签生成、仅标准答案和我们的判别分类头)以及五个基准:HellaSwag、WinoGrande、PIQA、SciQ 和 ARC-C。分类头 微调 在 0.6B 和 1.7B 尺度上可靠地优于标签生成 (+2-3%)。此外,使用判别方法微调的 TLM 与零/少样本 GPT-3 (175B)、PaLM (540B) 和 GPT-4 具有竞争力。我们报告的 Qwen3-0.6B 和 Qwen3-1.7B 的性能在 HellaSwag、WinoGrande 和 PIQA 上均达到 SOTA。