论文

DART:混合推理模型免训练自适应思考预算的草稿一致路由

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

模型推理测试时计算扩展

摘要

混合推理模型可以直接回答——也可以在扩展思考上花费额外token。实用的路由器应为每个查询在两种模式间选择——使简单问题避免不必要推理、困难问题获得足够预算完成答案。既有路由器朝该方向前进——但通常需要标注训练数据或预先固定思考预算——忽视来自模型自身的答案级证据。我们介绍DART——免训练路由框架:采样两份廉价的免思考草稿——草稿一致时接受直接回答——不一致时从草稿熵预测思考预算。在主要比较中——DART在多数设定下保持或提升always-thinking准确率——同时降低思考token使用。准确率在奥赛级数学最高+9.0分、代码(按执行等价)最高+22.5分——思考token使用降32-73%。第1阶段信号跨模型规模(0.6B-32B)、模型家族与仅API托管设定扩展——无需标注数据、无需梯度更新。代码见 https://github.com/js-lee-AI/DART。

DART:混合推理模型免训练自适应思考预算的草稿一致路由:论文配图
图 1:DART 概述。第 1 阶段绘制 K=2K{=}2 个无思考草稿,并在同意后接受一致答案。如果出现分歧,第二阶段会将草稿熵映射到特定于查询的思维预算,并在单独的完成中生成答案。