论文
ODAR:基于主动推理的LLM推理原则性自适应路由
ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference
摘要
大语言模型(LLM)推理的范式正从参数规模扩展转向测试时计算扩展,然而许多现有方法仍依赖统一的暴力采样(例如固定的best-of-N或自洽性),这类方法成本高、难以归因,并可能触发收益递减的过度思考。我们提出ODAR-Expert,一个通过原则性资源分配优化准确率-效率权衡的自适应路由框架。ODAR使用以摊销主动推理为基础的难度估计器,在启发式的Fast Agent与深思的Slow Agent之间动态路由查询。我们进一步引入受自由能原理指导、风险敏感的融合机制,通过最小化变分自由能目标来选择答案,平衡对数似然与认知不确定性(varentropy),作为对异构候选进行临时投票的原则性替代。在23个基准上的大量评估显示出强劲且一致的收益,包括MATH上98.2%的准确率和Humanity's Last Exam(HLE)上54.8%的准确率,同时在算力匹配设置下改进了计算-准确率前沿。我们还在完全开源的技术栈(Llama 4 + DeepSeek)上验证了可复现性,ODAR在把计算成本降低82%的同时超越同质采样策略。总体而言,我们的结果表明,最优思考规模的扩展需要基于自由能决策的自适应资源分配,而非单纯增加测试时计算。
