论文

通过无标签支票定价进行风险控制的选择性大语言模型答题

Risk-Controlled Selective LLM Answering by Pricing Label-Free Checks

模型评测鲁棒性、公平性与可信度评测

摘要

从大语言模型提供答案需要决定何时弃权,但验证者的排名准确性本身并不能决定提供的答案之间的错误率。我们引入了 PriceCheck,它通过无标签检查(例如重新解决问题)构建了一系列紧凑的决策规则。每项检查都有一个价格:正确和错误答案的一致率以及每次运行的成本。安装在一个小型的、类别丰富的标签集上的价格构成了对时间表覆盖范围和成本的预测,指导运行哪些检查以及何时停止。然后,校准测试会根据规定的选择性风险目标选择一个时间表。在数学方面,选定的计划平均提供 76.1% 的答案,并将所有 15 次分组中保留的选择性风险保持在 1.5% 以下。在共享测试协议下,PriceCheck 在该目标上提供比奖励模型、提示判断、生成器置信度和训练有素的正确性分类器更多的答案。在匹配的覆盖范围内,它在这些评分者中保留的错误答案最少。在 118 个诊断计划中,基于价格的覆盖范围预测与观察到的覆盖范围的等级相关性为 0.97。这些结果表明,选择如何组合和停止检查与验证者对答案的排名一样重要。代码可在 https://github.com/js-lee-AI/PriceCheck. 获取