论文
DART:混合推理模型免训练自适应思考预算的草稿一致路由
DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models
摘要
混合推理模型可以直接回答——也可以在扩展思考上花费额外token。实用的路由器应为每个查询在两种模式间选择——使简单问题避免不必要推理、困难问题获得足够预算完成答案。既有路由器朝该方向前进——但通常需要标注训练数据或预先固定思考预算——忽视来自模型自身的答案级证据。我们介绍DART——免训练路由框架:采样两份廉价的免思考草稿——草稿一致时接受直接回答——不一致时从草稿熵预测思考预算。在主要比较中——DART在多数设定下保持或提升always-thinking准确率——同时降低思考token使用。准确率在奥赛级数学最高+9.0分、代码(按执行等价)最高+22.5分——思考token使用降32-73%。第1阶段信号跨模型规模(0.6B-32B)、模型家族与仅API托管设定扩展——无需标注数据、无需梯度更新。代码见 https://github.com/js-lee-AI/DART。
