论文

成本感知多目标强盗:预算 LLM 配置评估的理论与应用

Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

模型评测评测方法与指标

摘要

由于有限的评估预算、不同的成本和多个相互竞争的目标,大语言模型 (LLM) 配置评估具有挑战性。在本文中,我们将 LLM 配置评估制定为成本感知的多目标老虎机问题,其中每个配置评估都会产生依赖于配置的成本并产生噪声向量值结果。在此框架下,我们研究两个基本问题:在线配置选择和Pareto配置识别。对于在线配置选择,我们提出了一种基于超容量的 UCB 算法,该算法优化了乐观的超容量每成本指数。我们建立了$O\bigl(\sum_{i\ne i^\star}\frac{\log B}{Δ_i}\bigr)$阶的预算遗憾界限,其中$B$是评估预算,$i^\star$是超体积效率方面的最优配置,$Δ_i$是配置$i$对应的效率差距。该界限保留了经典单目标预算老虎机的对数预算依赖性。对于固定预算 Pareto 识别,我们开发了一种成本感知的经验差距消除算法,并证明其错误概率为 $O\bigl(\exp(-\frac{B}{H_{μ,c}})\bigr)$,其中 $H_{μ,c}$ 是成本感知的 Pareto 识别复杂度,具体取决于配置成本和 Pareto 分类差距。该错误概率随着评估预算呈指数衰减,并在所有配置成本相同时恢复标准帕累托集识别保证。 LLM 配置评估任务的实验表明,所提出的框架能够在有限的预算下实现高效的在线决策和准确的成本感知帕累托识别。