论文

TUDUM:Qwen3.5-27B 的土耳其思维推理管道

TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B

模型训练监督微调与指令调优

摘要

本文介绍了 TUDUM(Türkçe Düşünen Üretken 模型),这是一个将 Qwen 家族 27B 思维模型应用于土耳其语推理的项目流程。核心问题不仅是用土耳其语回答土耳其语提示,而且使明确的推理本身符合土耳其语。思维模型可以将土耳其语提示翻译成以英语为中心的内部或可见便签本,主要用英语解决问题,并且仅本地化最终答案。 TUDUM 相反,将生成的 <think>...</think> 块视为可训练的行为。该管道从项目基础检查点 unsloth/Qwen3.5-27B 开始,使用 LoRA 适配器在 15,991 个土耳其语推理示例上应用监督 微调 (SFT),然后在代理过滤的土耳其语数学环境上应用 GRPO 系列强化学习。结果好坏参半。 SFT 使模型变得更短,推理行为更加一致,平均响应长度和思维疲惫度大幅减少,但基准准确性降低。 RL 恢复了一些数学性能,尤其是在最佳早期检查点的 AIME24,但并没有统一改善所有基准,并且没有超过报告的 Macro-6 平均值的基础模型。因此,该贡献最好被视为技术上诚实的土耳其思维推理管道和评估,而不是对最先进的土耳其推理的主张。已发布的step-50模型已公开。