论文
你能有多小?用于金融交易中商户信息提取的 LoRA 微调 270M-8B 模型
How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions
摘要
商户信息提取将嘈杂的金融交易描述符转化为生产规模的结构化字段。我们部署的经过 LoRA 微调的 LLaMA~3.1-8B 达到 96.95% F1,但其内存和吞吐量需要更小的替代品。我们评估了 23 个保留的 微调 运行以及单独训练的生产参考,涵盖 LoRA 等级、提示、训练模板和服务环境中的 Gemma~3 (270M--4B)、Qwen~3.5 (0.8B--4B)、Aya~3.35B 和 LLaMA~3.1-8B。 8 级 LLaMA 微调达到 96.75% F1,仅比 32 级生产参考低 0.20 点。仅使用 JSON 提示的 Qwen~3.5~4B 达到 96.60\% F1,严格记录级精确匹配达到 91.67\%,逆吞吐量时间估计比 8 级 8B 模型低 3.8倍$。 Qwen~3.5~0.8B达到94.75\% F1,Qwen Think和Nothink模板相差不到0.004 F1。在 14 个 Databricks 端点中,本地评估的平均 F1 变化为 -0.0081; Aya 是唯一一个下降 2.7--5.1 点的家族。这些结果表明,紧凑的微调模型可以保留大部分提取精度,但模型选择必须考虑及时选择、吞吐量和服务堆栈行为。