论文
CantoneseLLM v2:用低资源语言进行推理
CantoneseLLM v2: Reasoning in a Low-Resource Language
摘要
粤语被广泛使用,但书面数据资源仍然很少,没有大量可用于 模型训练 的本地粤语推理痕迹语料库。我们开发并发布了 CantoneseLLM v2,包括基于 Qwen3 8B 和 30B-A3B 的模型。这些模型通过 CPT 对 7.84 亿个粤语和香港相关词元、聊天向量合并、SFT、DPO 和 RLVR 进行训练。整个训练阶段的评估表明,聊天向量合并转移了指令跟踪,但保留了捐赠者模型的推理语言,而具有有限粤语推理数据的 SFT 大大缩短或删除了推理痕迹并降低了基准性能。 DPO 恢复推理块格式,特别是对于 8B 型号,但仅恢复部分损失的性能。以粤语和繁体中文脚本作为乘法约束的 RLVR 训练引入了粤语语言对齐并恢复了损失的性能。 30B-A3B 模型在 HKCanto-Eval 上达到 73.16,与其合并检查点相差 1.20 分,同时保留了该检查点中不存在的粤语推理行为。我们发布了模型检查点、训练环境和十三年繁体中文通用爬行数据集。这些模型可以通过 https://huggingface.co/collections/hon9kon9ize/cantonesellm-v20 访问