数十亿美元的超级前沿:小语言模型与一般和文学关系提取上的零射击前沿 LLM 竞争
Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction
摘要
大语言模型 (LLM) 实现了强关系提取 (RE),但其计算需求和对专有 API 的依赖限制了在资源受限或隐私敏感设置中的部署。我们研究了小语言模型(SLM)可以在多大程度上缩小一般领域和文学文本之间的差距。我们在三种域组合体系和两种提示条件调整风格(30 个配置)下评估了从 360M 到 3B 参数的五个模型,并将它们与零样本前沿 LLM 和判别性 RoBERTa 基线进行比较。在九个基准测试中,最好的十亿级模型 Qwen2.5-0.5B 在汇总的通用域数据上进行了微调,实现了 0.83 的通用域正类微 F1,而 GPT-5.4 为 0.69,Claude Sonnet 4.6 评估零样本为 0.66。这并不意味着 SLM 本质上更强大;而是意味着 SLM 本质上更强大。相反,有针对性的任务适应使可部署在单个消费级 GPU 上的 4 位模型能够超越该协议下的通用前沿系统。域内 RoBERTa 基线也超过了两个前沿模型,表明增益源于任务适应而不是生成解码。在文学 RE 上,调整后的 SLM 在人工注释的传记基准上达到 0.92,而 GPT-5.4 为 0.83;在两个基准文学平均值上,SLM 为 0.833,而为 0.578。与有监督的 微调 相比,有针对性的领域自适应预训练案例研究没有产生任何实际有意义的收益,而最干净的家庭内规模比较仅显示出边际改进。这些结果表明,当特定于任务的数据可用时,紧凑的任务适应模型可以提供准确、私密且硬件高效的 RE。