论文
通过相互促进隐式和显式推理来解锁 LRM 中的细粒度翻译质量估计
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Mutually Boosting Implicit and Explicit Reasoning
摘要
即使推理链很长,大型推理模型 (LRM) 仍然难以进行细粒度的翻译质量估计 (QE)。我们认为 LRM 已经具备强大的多语言能力,而核心挑战源于学习细粒度 QE 任务的内在困难。在本文中,我们提出了 $\textbf{RIEQE}$ ($\textbf{I}$mplicitly 和 $\textbf{E}$xplicitly for $\textbf{QE}$),这是一个简单的两阶段训练框架,可以相互增强隐式(逐层)和显式(词元式)推理能力。为了使隐式推理变得可行,我们首先将复杂的 QE 任务分解为简单的子任务。基于此,我们的两阶段方法适用:(1)$\textit{NonThinking-SFT}$,无推理链的监督微调(SFT),直接提升模型的隐式推理倾向和能力; (2) $\textit{Thinking-RLVR}$,标准强化学习与可验证奖励(RLVR),以随后强化显式推理。在WMT测试集上,基于Qwen3-4B-Thinking-2507的RIEQE在显式推理性能上超越了所有基线,而其隐式推理能力也可与当前最好的基于编码器的模型相媲美。我们进一步提供了隐性推理和显性推理之间相互促进的证据,展示了它们如何以双向方式彼此受益。我们的代码可在 https://github.com/NJUNLP/RIEQE 获取。