论文

输入无关对照揭示跳层与重复层评测的选择偏置

Input-Blind Controls Produce Substantial Oracle Headroom for Layer Programs in Multiple-Choice Evaluation

模型评测模型推理测试时计算扩展评测方法与指标模型行为与机制分析

摘要

自适应计算旨在通过针对每个输入定制执行来改进语言模型推理。对于层程序,在实际选择器可用之前,预言机评估使用已知答案来估计这种灵活性的潜在收益。然而,选择带来的收益本身并不能解释为什么所选项目会有所帮助。本研究在两个模型和 4,413 个多项选择题上使用 32 个跳层和重复程序来检验这种区别。该分析将他们在没有评估提示的情况下选择的固定动作的收益与在相同地点的输入盲扰的收益进行比较,并在另一个提示下重新评估选择。在共享选项顺序的情况下,控件在 Qwen3-4B-Base 和 Llama-3.1-8B 上提供了 10.2-11.8 和 15.6-19.4 个百分点的净空,在每个模型的所有三个随机方向抽取中超过了实际程序的 9.0 和 10.1。它们仅匹配答案更改率,并且顺序取决于菜单:在事后比较中,真实程序在每次抽奖中都领先于 Llama 的仅重复菜单。较小的 KL 校准比较,包括 依赖于输入的控制,有利于点估计中的实际程序,并具有不确定的校正测试。固定字母偏移会产生类似比例的净空。轮换期权大大减少了两个家族的净空,同时留下 1.4-2.3 点和 3.7-4.5 点的正实际负控制差异;它们的大小和统计支持取决于进一步的调整和参考。补充生成答案测试发现,在没有安慰剂比较的情况下,在改写后,搜索选择的程序比为其他问题选择的程序保持了 26.0 分的优势。这些结果表明,大量的余量可以在具有共享选项顺序的提示中持续存在,而无需建立特定于所选层计算的好处;任何针对这些控制措施的订购都没有体现出这种好处。