论文

从发现到决策:大语言模型投票中的有限预算可收回性

From Discovery to Decision: Finite-Budget Recoverability in LLM Voting

模型推理测试时计算扩展

摘要

对多个 LLM 响应进行投票是测试时计算扩展和集成推理中的常见原语。收集更多答案可以扩大候选池并增加发现正确答案的机会。在固定的通话预算下,发现的答案仍然需要在剩余的通话中积累足够的支持才能成为最终的多数获胜者,从而造成发现与决策之间的差距。在这项工作中,我们通过已实现的投票状态和剩余呼叫预算来描述这一差距。我们得出了一个尖锐的可恢复性阈值,并表明,随着采样的进行,观察到的候选集只能扩大,而可到达的端点获胜者集只能收缩,从而产生候选级转换窗口。在指定的独立同分布响应律下,相同的状态会产生精确的有限范围端点概率。我们进一步表明,合并错误答案身份保留了单次调用的正确性,并且不能提高复数准确性,并且重新分配错误答案概率的效果取决于实现的投票状态。单例可达性产生无金的精确锁定证书。对于已知的答案宇宙,其第一个触发器是所有可接受的延续产生相同固定预算输出的最早前缀。根据经验,大多数已发现但未选择的正确答案只有在发现后才会失去可达性。在一项受控 Word16 研究中,输入排列将原始复数精度提高了 21.1 个点,而单次调用正确性基本不变。精确锁定可在 16 次调用预算下节省 28-30% 的调用次数,同时保留每个固定预算输出。