论文
提示调整:更少的数据可以带来更好的推理
Hint Tuning: Less Data Makes Better Reasoners
摘要
大型推理模型通过扩展的思想链实现了高精度,但生成的标记比必要的多 5--8 个,无论问题难度如何,都统一应用详细推理。我们提出了提示调优(Hint Tuning),这是一种数据高效的方法,可以教会模型校准推理深度。我们的主要见解:相应的指导模型可以作为理想的难度探测。通过测试指令模型在不同指导下可以解决的问题,我们自动构建跨三种状态的训练数据:No-Hint(直接答案)、Sparse-Hint(最小前缀)和 Full-Hint(完整推理)。这将难度标记的抽象挑战转化为指令模型和推理模型之间可测量的一致性检查。仅使用 1K 个自注释样本,Hint Tuning 在多个尺度(4B--32B)的主流推理模型(Qwen3-Thinking、DeepSeek-R1-Distill)中实现了 24--66% 的标记减少(平均 31.5%),同时在五个基准上保持有竞争力的准确性。与需要大量 蒸馏 数据集或昂贵的 RL 的方法不同,我们通过与指令模型功能的简单对齐来实现卓越的效率。代码和数据可在 https://github.com/redai-infra/hint-tuning 获取。