论文

分片可防止 LLM 监督失败和对抗性利用

Sharding Prevents LLM Oversight Failures and Adversarial Exploitation

模型评测评测方法与指标

摘要

为 LLM 判断提供更多计算并不一定会使其检查更多要求。当一个调用必须返回多个判决时,即使该调用收到与一组单独调用相同的词元或工具预算,某些决策也会变得缺乏证据依据。在专家分级的研究复制、法律工作和临床试验评估中,随着每次调用裁决数量的增加,与专家的一致性下降。我们将分片视为缓解基于模型的监督失败的干预措施。分片将需求划分为更小的组,将每个组分配给单独的调用,并聚合结论。与小组的全部预算的单一调用相比,分片可以提高一致性,同时保持模型、证据、总预算和每决策预算固定。总的来说,我们发现,一个分片较弱的法官可以胜过一个更有能力的整体法官,并且可以与该法官相匹配,即使后者收到了小组的全部预算。此外,我们发现分片对对手表现出鲁棒性。 N 中最好的对手可以固定基础作品,只改变其表现形式,并成倍提高超载的法官对真正未满足标准的接受度。无论分片减少基线误差,它都会消除这种对抗性优势,即使对手的搜索范围扩大,也能保持较低的过度接受度。分片并不能解决在每个标准上分别说服法官而不是利用过载的攻击。在这种情况下,我们发现分片之上的辩论式反对能够承受这种自适应重新优化。