论文
留意输出上限:词元预算改变多语言推理差距的测量
Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap
摘要
多语言评测通常只报告一个输出词元上限下的准确率,但表达相同内容,不同语言需要不同数量的词元,因此上限是隐藏的实验变量。本文在四种提示策略下,检验Qwen3-8B和Llama-3.1-8B-Instruct在MGSM德语、泰语与斯瓦希里语上的原语言作答与翻译后作答差距,是否来自词元预算。测得差距随预算最多变化57个百分点;上限构成约束时,长度归一化最多改变38.9个百分点,紧预算下甚至逆转策略排名。研究预先固定三个Qwen峰值和1024预算处接近零的结果,再以540000次独立硬上限解码验证;第二组经Holm校正的六项检验均拒绝零假设。固定的B*=1024检验仍不能拒绝零假设,因为原语言准确率在此已饱和;饱和后的剩余差异是策略表现差距,不能直接归为推理能力缺陷。同一截断机制还影响按成本分层的适配收益:交叉拟合的泰语词表扩展在固定预算下缩小差距0.0个百分点,在仍有19%轨迹截断的条件下缩小4.9个百分点。第三组固定检验只改变告知模型的预算,保持实际硬上限不变;告知128而非2048词元使泰语原语言准确率变化5.1个百分点,说明准确率不只由强制上限决定。从一次长预算运行计算的正确答案输出时间关系,与三个预定MGSM峰值的误差为0.65个百分点。在另外三个基准的探索性Qwen分析中,对留出样本的误差为0.92个百分点,并在七个条件中的五个准确定位峰值。研究建议把输出上限作为独立变量,报告不同预算条件下的准确率,而非只给单一预算结果。