论文
两次调用、两个时刻以及重复 LLM 推理的投票准确率曲线
Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference
摘要
重复采样是测试时计算的一种标准方法,但其好处是由示例中正确性的潜在分布控制的,而不是仅由一次调用的准确性来控制。我们研究了条件独立同分布下重复 LLM 推理的二进制正确性层。来电。一个标记的呼叫可确定平均潜在成功概率;两个标记的调用识别其第二时刻,从而确定相同示例的正确性相关性,将稳定错误与可恢复的调用级随机性分开。从这两个时刻开始,每个固定的多数票预算都有一个尖锐的无分配两次调用间隔。关键的技术简化在于,无限维矩问题对于每个有限预算都有三原子极值化和二次对偶证书,因此边界是精确的,而不是离散或参数化的。第一个有用的预算,三票,有一个封闭的形式,宽度至多 $1/8$,以及一个经过认证的改进标准。无限投票端点是多数投票的极限,因为调用次数趋于无穷大;它也有很大的界限,但仍然对阈值敏感,因为它取决于 $q=1/2$ 附近的潜在质量。我们添加了最大熵和潜在难度高斯概率点完成,并且通过 QNLI 和 QQP 进行 LLM 调用的实验表明,经验三票和五票精度包含在预计的两次调用区域中,而温度变化和随机模型混合可以创建不按一次调用精度排序的投票增益。