论文

大小很重要:捷克 HTML 文档的基础模型

Size Matters: Foundation Model for Czech HTML documents

模型优化小模型/轻量模型

摘要

在高流量工业环境中创建通用、高质量的 Web 文档表示需要既高性能又经济的模型。然而,现有的方法通常依赖于大型模型,忽略了 HTML 中固有的结构信息,或者受到短上下文窗口的限制,从而限制了它们处理现实世界网页的能力。我们提出了 HTML-LM,这是一个具有 1.54 亿个参数的紧凑基础模型,通过 HTML 感知训练和基于 ModernBERT 的架构解决了这些限制。它使用多个目标对 1 亿个网络文档进行了训练,包括掩码语言建模、词袋预测和大型语言模型的对比蒸馏。因此,HTML-LM 为捷克互联网领域的分类和回归应用树立了新的最先进水平,超越了大型编码器和小型 LLM。该模型部署在生产中,每秒处理数千个 Web 文档,并根据 CC BY-NC 4.0 发布到社区。 https://huggingface.co/Seznam/html-lm。