论文
根据精确的贝叶斯最优参考来衡量语言模型中的上下文算法推理
Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal reference
摘要
大语言模型 是否执行算法推理或模式完成很难测试,因为大多数基准测试提供答案,但没有显示证据许可的分布式参考。 F-ICL 准确地提供了一个:我们在图灵完备的机器 F 上详尽地枚举了长度最多为 13 的 8600 万个有效程序,通过补码对称来消除输出极性偏差,并在声明的有界 Levin-Solomonoff 先验下计算精确的后验。对于所述先验而非通用而言,它是贝叶斯最优的,并且模型从未被告知它存在,因此分数读取其服务分布已经编码的归纳先验。在涵盖从 0.8B 到 675B 的开放模型和前沿系统的 105 个服务配置中,模型正确回答了高达 92% 的查询,但 46 个公开分布中的 45 个分布距离 F 参考比击键参考更远。这不是任务选择的人为因素:在位坐标上,一半的长度配额不能扭曲,80 条运行中的 69 条保持在锚点以下。保真度对比例是惰性的,而精确度则跟踪它;延续在后期得到改善而不收敛;模型每两次增益就会取消解决一次已解决的任务,而 F 参考则每九次取消一次并总是修复它。因为绝对距离依赖于参考,所以我们证明了对立先验的连续界限:任何其先验给出参考正权重的预测器都具有有限的累积超额损失,并且,在从不调用参考的损失中,任何给出已实现的真值正质量的贝叶斯混合都具有有限的真值损失预算。在 23,998 条轨迹中,86.7% 已经花费了超过 10 位。以位置九结尾的序列不能排除任意大的有限常数,因此这些是竞争对手先验必须已经支付的下限。 F-ICL 是一个开放的基准测试和工具包。