论文

随机大语言模型的推测性评估

Speculative Evaluation of Stochastic LLMs

模型评测评测方法与指标

摘要

评估随机大型语言模型的成本很高:基准分数估计随机采样轨迹的预期性能,但统一重复忽略了任务级采样轨迹方差的巨大差异。我们询问如何在精确的采样轨迹预算下最小化固定基准均值的方差。我们使用分层贝叶斯内曼 (HBN) 策略开发推测性评估,其中试点规模和阶段权重是事先共同选择的。它运行一个简短的统一试点,使用分层贝叶斯模型汇集每个任务的成功计数,并使用任务级采样方差的后验期望来实现精确的正整数内曼分配。为了减轻导频同步障碍,HBN-async 推测性地执行部分导频反馈的延续,并保留最终分配选择的那些。在 6 个检查点和 18 个基准组中,我们评估了 107 个非退化基准检查点配置文件。对于每项任务 8-64 的部署预算,推测性评估相对于均匀评估,跨配置文件平均减少了 12.8%-33.6% 的方差,优于事后调整的经验和独立贝叶斯基线。考虑到导频同步障碍的实际生成实验表明,HBN-async 减轻了其开销,有助于将统计效率转化为实际的评估收益。