论文

ROI-Reasoning:通过预计算元认知实现推理的理性优化

ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition

模型训练强化学习

摘要

大型语言模型(LLM)在计算充足时可以取得很强的推理表现,但它们天生并不知道一项任务需要多少计算。我们研究严格全局token约束下多任务的预算化推理期分配问题,并将其形式化为有序随机多选背包问题(OS-MCKP)。这一视角凸显了一种元认知需求——预判任务难度、估计投入回报(ROI)并有策略地分配计算。我们提出ROI-Reasoning,一个赋予LLM内在预算感知理性的两阶段框架。第一阶段,元认知微调教会模型在生成前预测推理成本与期望效用,从而做出明确的解题或跳过决策。随后,理性感知强化学习在硬性token预算下优化序贯决策,让模型学到长程分配策略。在多个预算化数学推理基准上,ROI-Reasoning持续提升总分,同时在紧张计算预算下大幅降低遗憾值。

ROI-Reasoning:通过预计算元认知实现推理的理性优化 配图
图 2:ROI-Reasoning 框架概览,包括元认知微调(Meta-Cognitive Fine-Tuning)与理性感知强化学习(Rationality-Aware Reinforcement Learning)。