论文
Ada-RS:面向选择性思考的自适应拒绝采样
Ada-RS: Adaptive Rejection Sampling for Selective Thinking
摘要
大语言模型(LLM)越来越多地部署在对成本和延迟敏感的场景。思维链虽能改进推理,却可能在简单请求上浪费 token。我们研究使用工具的 LLM 的选择性思考,并提出 Adaptive Rejection Sampling(Ada-RS),一个与算法无关的样本过滤框架,用于学习有选择且高效的推理。对每个给定上下文,Ada-RS 用自适应长度惩罚奖励对多个采样补全打分,然后应用随机拒绝采样,仅保留高奖励候选(或偏好对)用于下游优化。我们展示 Ada-RS 既可接入偏好对(如 DPO)策略,也可接入分组策略优化(如 DAPO)。在面向工具调用的合成电商基准上使用 Qwen3-8B 加 LoRA,Ada-RS 改善了准确率-效率前沿:平均输出 token 最多减少 80%,思考率最多降低 95%,同时保持或提升工具调用准确率。这些结果表明,训练信号选择是延迟敏感部署中实现高效推理的有力杠杆。
