论文

Ada-RS:面向选择性思考的自适应拒绝采样

Ada-RS: Adaptive Rejection Sampling for Selective Thinking

模型训练合成数据

摘要

大语言模型(LLM)越来越多地部署在对成本和延迟敏感的场景。思维链虽能改进推理,却可能在简单请求上浪费 token。我们研究使用工具的 LLM 的选择性思考,并提出 Adaptive Rejection Sampling(Ada-RS),一个与算法无关的样本过滤框架,用于学习有选择且高效的推理。对每个给定上下文,Ada-RS 用自适应长度惩罚奖励对多个采样补全打分,然后应用随机拒绝采样,仅保留高奖励候选(或偏好对)用于下游优化。我们展示 Ada-RS 既可接入偏好对(如 DPO)策略,也可接入分组策略优化(如 DAPO)。在面向工具调用的合成电商基准上使用 Qwen3-8B 加 LoRA,Ada-RS 改善了准确率-效率前沿:平均输出 token 最多减少 80%,思考率最多降低 95%,同时保持或提升工具调用准确率。这些结果表明,训练信号选择是延迟敏感部署中实现高效推理的有力杠杆。

Ada-RS:面向选择性思考的自适应拒绝采样
图1:工具调用型 LLM 智能体中“始终思考推理”(thinking always reasoning)与“选择性推理”(selective reasoning)的对比。智能体即使面对简单的用户查询也执行显式推理,导致不必要的推理成本与延迟(左)。智能体选择性地跳过推理,直接调用合适的工具(右)。