论文
具有混合后处理的领域自适应小语言模型:通过 LoRA 微调 在稀缺数据上实现经济高效、低延迟的多标签结构化预测
Domain-Adapted Small Language Models with Hybrid Post-Processing: Achieving Cost-Efficient, Low-Latency Multi-Label Structured Prediction via LoRA Fine-Tuning on Scarce Data
摘要
为特定领域的结构化评估任务部署前沿 大语言模型 (LLM) 会产生过高的延迟、成本和数据隐私开销。我们提出了一个混合框架,仅在 219 个精选示例上微调小型语言模型(LLaMA 3.1 8B,通过 LoRA 实现 2.05% 可训练参数),并将其与基于确定性规则的后处理层结合起来。应用于会话转录本(18个异构输出字段)的多标签合规性评估,我们的系统在对53个未见过的生产转录本进行盲评估时,实现了100%的JSON结构有效性、83.0%的人工验证整体准确性以及最关键的分类字段的100%的准确性。在单个 NVIDIA A100 GPU 上,推理可在 $\sim$2 秒内完成,比前沿 API 快 2--5 倍,每次评估成本为 0.013 美元,而专有替代方案为 0.025--0.055 美元,节省了 46--76% 的成本。我们为关键决策边界引入了有针对性的硬负增强,并形式化了混合神经符号分解,证明具有后处理功能的领域适应小语言模型可以匹配前沿模型的准确性,同时显着降低运营成本、延迟和隐私风险。