论文
一个词元的充分算力是多少?MoA测量
What Does a Token Cost? A Mixture-of-Agents Measurement of Sufficient Per-Token Compute
摘要
大语言模型对生成的每个词元花费相同的计算,无论该词元多难产生。投机解码与模型路由等方法建立在"大量计算不必要"的前提上,但单个词元实际需要的计算从未被测量。我们通过智能体混合(MoA)的透镜测量它:来自三族、容量递增的十五个语言模型组成面板,每个智能体在给定正确前缀的条件下尝试逐词元复现参考序列。我们定义成功复现的最小智能体的推理成本为该词元的充分算力,它上界了词元所需。在三个核心基准上,0.5B智能体复现92-95%的参考词元。跨Qwen、OLMo与R1蒸馏面板,最昂贵的10%词元占估计FLOPs的64-80%。在全部500个MATH-500问题上,MoA衍生图谱帮助模型路由把预计延迟从7.59秒降至5.12秒并略升准确率(相对最佳置信路由基线);帮助起草比固定窗口起草少用32.6%草稿词元、预计延迟约降20%且准确率相近。这些比较揭示了剩余的分配空间,激励利用充分算力结构的控制器。