论文

任意时刻安全的高效PAC推理

Anytime Safe PAC Efficient Reasoning

模型推理测试时计算扩展

摘要

大型推理模型(LRM)在复杂任务上展现出卓越性能,但计算成本与延迟高昂。选择性思考策略通过把简单查询路由到非思考模型来提升效率,但现有方法常带来不可控的错误,尤其是在线设置下——非思考模型的性能损失只能被部分观测且数据非平稳。为此,我们提出Betting Probably Approximately Correct(B-PAC)推理,一个在部分反馈下实现任意时刻安全且高效在线推理的有原则方法。具体而言,我们利用逆倾向得分估计量为候选阈值构建检验上鞅,然后基于累积的安全统计证据动态调整路由阈值。理论上,我们建立B-PAC推理的任意时刻有效性能损失控制与效率。大量实验表明,B-PAC推理显著降低计算开销,最多将思考模型使用减少81.01%,同时把性能损失控制在用户指定水平以下。

任意时刻安全的高效PAC推理
图2:非平稳数据的 Anytime 安全性。结果报告于 MMLU-Pro 与 BBH 的合并数据集,其中 ϵ=0.05,α=0.1。