论文

通过顺序证据积累在 LLM 集成中实现自适应共识:自动预算识别和校准提交信号

Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals

模型推理推理策略与问题分解

摘要

大语言模型 集成提高了推理准确性,但仅限于性能边界,超过该边界,额外的深思熟虑会降低准确性。我们引入了 DASE(协商自适应停止集成),这是一种用于迭代集成审议的停止启发式方法,它尽早达成真正的共识,并对碎片证据应用全局频率回退。我们做出三项贡献。 (1) DASE 产生一个提交类型的路由分区,该分区可以跨基准泛化,并且是对语言化单次调用置信度的补充。在 GPQA 扩展(N=546,70B 整体)上,分区产生 39.5 pp 的路由间隙(右墙 81.1% 对左墙 41.5%)。在 AIME 2010-2023(N=261、120B ensemble、3 个种子)上,右墙提交准确率达到 98.3%,而左墙提交准确度为 72.8%(25.5 pp 差距),在统计上相当于匹配覆盖率的 Opus 4.6 标准语言置信度(25.7 pp 差距;bootstrap p=0.873);两种机制在 37% 的路由分配上存在分歧。 (2) 驱动精度的是自适应停止,而不是注入带宽。在 AIME-300 上,带宽仅占 0.3 pp (ns)。在 120B 层的 GPQA-Extended 上,稀疏注入($\approx15$ tokens/worker/round)实现了 70.9%,路由间隙为 30.7 pp;密集注射($\approx600$ chars/worker/round)达到 72.2%,但右壁覆盖率减半,差距缩小到 18.9 pp。 (3) 基于注入的方法表现出倒 U 型精度与推理轨迹;这种模式是假设生成的。