论文
Token Arena:统一AI推理能耗与认知的持续性基准
Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference
摘要
公开的推理基准在模型和供应商层面比较AI系统,但部署决策实际做出的单位是端点(endpoint):即(供应商、模型、库存单位SKU)三元组,特定的量化方式、解码策略、区域和服务栈在此暴露。我们提出TokenArena,一个以端点粒度沿五个核心轴(输出速度、首token时间、工作负载混合价格、有效上下文以及线上端点质量)测量推理的持续性基准,并将其连同建模的能耗估计合成为三个头条复合指标:每正确答案焦耳数、每正确答案美元数以及端点保真度(与一方参考的输出分布相似度)。该框架的新颖性体现在经验与方法层面。在服务12个模型家族的78个端点上,同一模型在不同端点的数学与代码平均准确率差异最高达12.5分,与一方参考的指纹相似度差异最高达12分,尾部延迟差异达一个数量级,建模的每正确答案焦耳数差异达6.2倍。我们进一步表明,工作负载感知的混合定价会大幅重排名次榜:聊天预设(输入:输出为3:1)下排名前十的端点中有7个在检索增强预设(20:1)下跌出前十,而推理预设(1:5)则抬升了在聊天预设中因价格受罚的前沿闭源模型。我们以CC BY 4.0发布框架、模式定义、探测与评估工具链以及v1.0名次榜快照。TokenArena是一种方法论而非单一排名;我们公布完整的来源信息与局限性,并欢迎外部复现。
