论文
共形级联:多层 LLM 推理的无分布精度保证
Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
摘要
大语言模型 (LLM) 级联通过将简单查询路由到小型模型并将硬查询推迟到较大模型来降低推理成本。生产级联通过置信度阈值控制此延迟,但 LLM 置信度分数校准错误,必须针对每个模型对和每个域调整阈值,并且任何设置都不会产生级联精度的正式界限。我们引入了 \textbf{Conformal Cascade} (CC),一个多层推理框架,它使用保形预测集大小作为延迟规则:当校准集折叠为单个答案时接受,否则延迟。该过程提供了无分布、有限样本的准确性保证。通过每层联合界限,对于任何用户指定的 $α$,接受层的预测集以至少 $1 - Kα$ 的概率覆盖正确答案;在选择保留条件下(与我们的边际覆盖结果一致,但并不严格暗示),界限收紧至 $1 - α$。我们进一步将预期级联成本描述为 $α$ 和校准集接受率的显式函数。在涵盖科学、医学、常识和标准化考试的 18 个多项选择基准中,对来自四个开放权重模型系列的两层级联进行评估,CC 严格改进了大多数系列基准对上最强的校准调整启发式级联,在多数投票不可靠的推理重基准上获得了最大的收益;在更简单的基准测试中,级联将绝大多数查询提交给小模型,并且没有准确性成本。扩展到开放式生成需要一个答案聚类步骤,我们将其留给未来的工作。该方法不需要 模型训练,只需要黑盒 API 访问。