论文
通过测试时间缩放缩小越南语与小语言模型的推理差距
Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling
摘要
无处不在的人工智能的民主化取决于在资源有限的设备上部署复杂的推理能力。然而,小语言模型(SLM)经常面临“推理差距”,特别是在越南语等非英语语言中,它们很难保持连贯的思想链。本文研究了越南初等数学背景下 Qwen3-1.7B 架构的测试时间扩展策略。我们引入了 Vi-S1K(通过 Gemini 2.5 Flash-Lite 支持的管道本地化的高保真推理数据集)和 Vi-Elementary-Bench(用于严格评估的双资源基准)。使用 LLM-as-a-Judge 协议,我们揭示了基本模型拥有强大的潜在知识(准确度:4.05/5.00),但在通信中存在严重的“格式差距”。受监督的 微调 (SFT) 充当关键的“推理解锁器”,使解释质量提高了 77%,并弥合了原始计算和教学连贯性之间的差距。此外,我们对提示策略的分析揭示了一个重要的权衡:像 ReAct 这样的结构化框架对 1.7B 参数容量施加了“认知税”,相对于纯粹的思想链 (CoT) 和自我一致性,降低了性能。这些发现为 SLM 建立了部署层次结构,表明 SFT 与简化的测试时间扩展相结合优于基于边缘推理的复杂代理工作流程。