论文
轻量多模态模型能估计LLM推理性能吗?一项面向计算最优文档推理的研究
Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference
摘要
为LLM统一分配推理预算既昂贵,又容易出现"过度思考"惩罚;在视觉版式驱动复杂度的文档任务中尤其如此。为此,我们提出BudgetDoc,首个在三个文档任务上为模型-预算-性能权衡提供显式监督的多模态基准。利用BudgetDoc,我们训练了DRB(Document-Reasoning Balancer),一个约1B参数的预检估计器(SigLIP-2 + Qwen3-0.6B),用于预测模型在各预算档位上的序数表现,加权F1达到0.753。在五个前沿模型和三个数据集上动态分配推理预算时,DRB在15组配置中的9组达到或超过始终使用最大预算基线的F1,同时大幅降低成本。最后,初步评估显示DRB有潜力泛化到跨模型选择。