论文
Chinese-Jev:将系统一模型引入中文任务
Chinese-Jev: Bringing System One Model to Chinese-Language Tasks
摘要
对于需要决策而不是开放式响应的任务,诸如 Jev 之类的 System One 模型为生成语言模型提供了一种有效的替代方案。然而,现有的 Jev 模型的中文决策准确性有限,限制了它们在一般和专业环境中的实用性。在本文中,我们介绍了 Chinese-Jev,这是一种 System One 模型,它通过统一的数据处理和训练管道来解决这一差距。我们的数据处理协议将异构中文注释转换为候选选项的概率目标,从而实现跨领域和问题格式的共享训练公式。为了实现高效推理,Chinese-Jev 采用轻量级仅编码器主干进行文本编码,并通过面向决策的训练学习对候选答案进行评分。为了解决预训练分布与下游中文场景之间的不一致问题,我们首先在包含 1000 万个示例的通用语料库上训练模型,然后针对医疗、法律和金融领域分别进行微调。为了评估一般和特定领域中文环境中的决策准确性和校准,我们引入了 Chinese-Jev Bench (CJ-Bench)。经过第一阶段预训练后,Chinese-Jev 在通用领域任务上的准确率比闭源 Jev 模型高出 1.24%,同时实现了 20.3 倍的加速。随后的特定领域微调在医学方面比 Jev 提高了 4.0% 的准确度,并在专业领域实现了 Jev 平均准确度的 92%,加速速度提高了 17 倍,每个示例的平均延迟仅为 15 毫秒。我们进一步演示了 INT8 量化模型在移动设备上的设备部署,实现每个决策约 1.0 秒的推理延迟。该项目可在https://gulucaptain.github.io/Chinese-Jev/.获取