论文

ScopeIF:用分级奖励训练LLM遵循局部约束

ScopeIF: Improving Scope-Aware Precise Instruction-Following in Large Language Models via Graded Reward Modeling

模型训练奖励建模与过程监督

摘要

精确的指令遵循是大语言模型(LLM)的基本能力,要求其输出严格满足输入指令的客观约束。在复杂的应用场景中,这些约束通常具有不同的范围,控制特定的响应片段而不是整个输出。然而,现有的优化方法通常在数据构建过程中忽略约束范围,并依赖于每个约束的二进制奖励,从而产生有限的数据多样性和对复杂约束的稀疏监督。为此,我们提出了 ScopeIF,这是一种用于范围感知精确指令遵循的新型训练框架。我们首先引入一个统一的模式,将目标约束分解为三个解耦的维度:范围、目标和范围。以此模式为基础,我们构建了具有多种范围感知约束的大规模指令数据集ScopeInstruct,并将基于工具的验证与分级奖励建模相结合,量化每个约束的违反程度,为策略优化提供密集监督。大量实验表明,ScopeIF 始终优于现有方法,特别是在复杂的范围感知约束方面,同时保留了一般功能。值得注意的是,它使优化的 Qwen3-4B 和 8B 模型能够与 Gemini-2.5-Pro 和 DeepSeek-V3.2 等强大的前沿模型相媲美或超越,为推进范围感知指令遵循建立了有效的范例。我们的代码和数据可在 https://github.com/thu-coai/ScopeIF. 获取