论文
策略性自洽:推理路径重排可能掩盖多收费
Strategic Self-Consistency
摘要
自一致性已经成为一种流行的技术,通过生成多个推理路径并通过多数投票选择最终答案来增强大型语言模型的推理能力。然而,由于模型提供商通常按照生成的推理路径数量的比例向用户收费,因此他们有经济动机人为地增加路径数量。在这项工作中,我们表明,不忠实的提供者可以使用简单、有效的算法来利用这种激励,同时避免被审计员发现:通过生成和策略性地重新排序额外的推理路径,该算法使每条路径都显得是形成多数结论所必需的。为了验证我们的算法,我们在数学、科学和问答的基准数据集上使用 Llama 和 Qwen 系列的多个指令模型以及从 DeepSeek-R1 中蒸馏得到的推理模型进行了实验。我们的结果表明,我们的算法生成的附加推理路径的分布是重尾的,即使在旨在将误报率保持在 $α= 0.1$ 以下的最佳审计下,仍然存在大量的过度收费能力。
