论文
DistilledGemma:平衡效率与准确性的多语言历史文章人地关系提取
DistilledGemma: Balanced Efficiency-Accuracy for Person-Place Relation Extraction from Multilingual Historical Articles
摘要
我们推出了 DistilledGemma,这是一个高效、准确的系统,用于 HIPE-2026 共享任务,从英语、德语和法语的多语言历史报纸文章中提取人物与地点关系。我们的方法采用三级 知识蒸馏 管道,旨在平衡分类精度与计算效率。在第一阶段,我们系统地探索了八个 大语言模型 的即时工程策略,以确定针对这项具有挑战性的任务的最有效的推理架构。在第二阶段,我们通过 QLoRA 将有监督的 微调 (SFT) 应用到 Gemma 4 26B A4B 教师模型中,利用其强大的多语言功能在整个训练语料库中生成银标准的思想链轨迹。在最后阶段,我们执行了响应级 蒸馏,将这些学习到的推理模式转移到紧凑的 Gemma 4 E2B 学生模型中。在官方评估中,我们的团队WHEREAMI在标准测试集上排名第三,准确率平均得分为0.688,在二进制测试集上排名第二,平均得分为0.8156。值得注意的是,通过将 26B 教师的知识提炼给 2.3B 学生,我们保留了强大的推理能力,同时将部署的模型大小减少到大约 2.3B 有效参数;训练期间使用的 LoRA 适配器被合并到学生中以进行推理。该配置在标准和二进制测试集的平衡效率-准确度分布中排名第二。这些结果表明,知识蒸馏 为历史文档处理提供了实用且可扩展的解决方案,无需过多的计算成本即可实现具有竞争力的性能。