论文

ODAR:基于主动推理的LLM推理原则性自适应路由

ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference

模型推理测试时计算扩展

摘要

大语言模型(LLM)推理的范式正从参数规模扩展转向测试时计算扩展,然而许多现有方法仍依赖统一的暴力采样(例如固定的best-of-N或自洽性),这类方法成本高、难以归因,并可能触发收益递减的过度思考。我们提出ODAR-Expert,一个通过原则性资源分配优化准确率-效率权衡的自适应路由框架。ODAR使用以摊销主动推理为基础的难度估计器,在启发式的Fast Agent与深思的Slow Agent之间动态路由查询。我们进一步引入受自由能原理指导、风险敏感的融合机制,通过最小化变分自由能目标来选择答案,平衡对数似然与认知不确定性(varentropy),作为对异构候选进行临时投票的原则性替代。在23个基准上的大量评估显示出强劲且一致的收益,包括MATH上98.2%的准确率和Humanity's Last Exam(HLE)上54.8%的准确率,同时在算力匹配设置下改进了计算-准确率前沿。我们还在完全开源的技术栈(Llama 4 + DeepSeek)上验证了可复现性,ODAR在把计算成本降低82%的同时超越同质采样策略。总体而言,我们的结果表明,最优思考规模的扩展需要基于自由能决策的自适应资源分配,而非单纯增加测试时计算。

ODAR:基于主动推理的LLM推理原则性自适应路由
图2:ODAR 系统架构(概览)。给定输入 x x ,基于规则的调度层(ER/MR/SS;固定启发式与优先级规则)提取粗粒度任务特征,并选择用于分发的基础模型标识符。与此同时,难度估计器(Difficulty Estimator)预测 d ∈ [ 0 , 1 ] d\in[0,1] ,策略选择器(Strategy Selector)使用固定阈值 τ 1 = 0.3 \tau_{1}{=}0.3 与 τ 2 = 0.7 \tau_{2}{=}0.7 对查询进行路由:简单( d < τ 1 d{<}\tau_{1} ):仅 Fast( c = 1 c{=}1 );中等( τ 1 ≤ d < τ 2 \tau_{1}{\leq}d{<}\tau_{2} ):Fast + Slow 验证( c = 2 c{=}2 );困难( d ≥ τ 2 d{\geq}\tau_{2} ): Best-of- N N ,取 N = 5 N{=}5 个 Slow 候选并进行 FEP 融合( c = 6 c{=}6 )。我们的评估侧重于基于难度的路由与 FEP 融合;ER/MR 提供系统级的调度/模型选择。