论文
最佳采样温度什么时候随预算上升? Pass@k 的充分条件
When Does the Best Sampling Temperature Rise with the Budget? Sufficient Conditions for Pass@k
摘要
对于较小的采样预算,最大化 pass@$k$ 的温度通常较低,而对于较大的预算,则温度较高。食品法典委员会通过最近的多样本推理研究报告了这种模式。它不是 pass@$k$ 的代数属性:如 Slocum 等人。 (ICLR 2025) 观察到,对于一项固定任务,最大化温度与 $k$ 无关。基于固定任务观察和困难/简单任务解释,我们为总体模式给出了正式的人口水平充分条件。对于任务 $X$,令 $p_t(X)$ 为温度 $t$ 下的单样本成功概率,并定义条件对数成功响应 $m_t(u)=\mathbb{E}[\dot p_t(X)\mid p_t(X)=u]/u$。如果 $m_t(u)$ 在当前成功概率中不增加,则聚合 pass@$k$ 的归一化温度导数在 $k$ 中不减少。因此,衍生符号嵌套在预算中;如果每条温度性能曲线严格是单峰的,则其独特的最大化器在 $k$ 上是不递减的。该证明将该机制确定为单调似然比权力向低成功任务倾斜。我们推导出一个封闭形式的两层相图,包括向上和向下的状态,并表明边际温度导数允许精确的 $\mathrm{Beta}(2,k)$ 内核表示,其内核集中于 $1/k$ 阶的单样本成功。将这种规模解释为任务级定位还需要一个接近于零的规则的、不为零的密度响应因子。符号矩表示产生诊断形状限制,而简短的附录记录了现有多配置分配公式的精确离散细化。没有训练语言模型,也没有使用模型查询作为实验测量:贡献是已建立的经验现象的条件理论,以及可以在未来工作中进行测试的假设。