论文

具有可行性感知覆盖保证的 大语言模型 集值预测

Set-Valued Prediction for Large Language Models with Feasibility-Aware Coverage Guarantees

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 本质上在较大的生成空间上运行,但传统用法通常将最可能的生成 (MLG) 报告为点预测,这低估了模型的能力:尽管排名靠前的响应可能不正确,但有效答案可能仍然存在于更广泛的输出空间中,并且可以通过重复采样发现。这一观察结果推动了从点预测转向集值预测,其中模型产生一组候选响应而不是单个 MLG。在本文中,我们提出了一个集值预测的原则框架,它提供了可行性感知的覆盖保证。我们表明,考虑到 LLM 生成的有限采样性质,覆盖并不总是可以实现:即使进行多次采样,LLM 也可能无法对采样候选集中的某些问题产生可接受的响应。为了解决这个问题,我们建立了最低可实现风险水平(MRL),低于该水平就无法满足统计覆盖率保证。基于这一见解,我们随后开发了一个数据驱动的校准程序,通过估计严格的阈值,从采样响应构建预测集,确保只要目标风险水平可行,结果集就包含具有所需概率的正确答案。使用五个 LLM 对六种语言生成任务进行的广泛实验证明了我们框架的统计有效性和预测效率。