论文
理解为无套利:有界荷兰语书籍作为语言模型的定义和训练目标
Understanding as No-Arbitrage: Bounded Dutch Books as a Definition and Training Objective for Language Models
摘要
语言模型只是预测标记,还是理解它所说的内容?我们通过从无套利的角度定义“理解”来使这个问题变得可衡量。如果计算有限的交易者无法通过对逻辑相关的主张(一本“荷兰书”)的模型概率进行下注来获取有保证的利润,则模型在一定程度上理解词汇表。我们建立了三个理论结果:首先,因为完全的逻辑一致性在计算上是难以处理的,所以理解本质上是分级的,而不是绝对的。其次,我们证明标准下一个标记预测的精确最优在不同的问题格式中本质上是不一致的;缺陷在于训练目标,而不是架构。第三,我们表明不确定性沿着推理链可预测地累积,使不合理的过度自信本身成为套利机会。为了解决这个问题,我们引入了 Arbitr,这是一个训练框架,对抗性交易者会因逻辑不一致而惩罚模型,并与校准锚配对以防止无信息崩溃。通过对 Qwen2.5 和 Phi-3.5 模型进行的五个预先注册的实验,我们证明标准模型在不同的措辞中具有高度的可利用性。 Arbitr 在不牺牲任务准确性的情况下将这种可利用性降低了几个数量级,并且效果成功转移到了看不见的逻辑模式和新模型系列。至关重要的是,我们发现了一种缩放错觉:在 7B 参数下,接近零的测量不相干性通常与极端的、不合理的置信度相一致。我们的结论是,虽然 Arbitr 强制执行严格的逻辑一致性,但连贯性是知识的必要条件,但不是充分条件