论文

Token Arena:统一AI推理能耗与认知的持续性基准

Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference

模型评测基准与评测资源

摘要

公开的推理基准在模型和供应商层面比较AI系统,但部署决策实际做出的单位是端点(endpoint):即(供应商、模型、库存单位SKU)三元组,特定的量化方式、解码策略、区域和服务栈在此暴露。我们提出TokenArena,一个以端点粒度沿五个核心轴(输出速度、首token时间、工作负载混合价格、有效上下文以及线上端点质量)测量推理的持续性基准,并将其连同建模的能耗估计合成为三个头条复合指标:每正确答案焦耳数、每正确答案美元数以及端点保真度(与一方参考的输出分布相似度)。该框架的新颖性体现在经验与方法层面。在服务12个模型家族的78个端点上,同一模型在不同端点的数学与代码平均准确率差异最高达12.5分,与一方参考的指纹相似度差异最高达12分,尾部延迟差异达一个数量级,建模的每正确答案焦耳数差异达6.2倍。我们进一步表明,工作负载感知的混合定价会大幅重排名次榜:聊天预设(输入:输出为3:1)下排名前十的端点中有7个在检索增强预设(20:1)下跌出前十,而推理预设(1:5)则抬升了在聊天预设中因价格受罚的前沿闭源模型。我们以CC BY 4.0发布框架、模式定义、探测与评估工具链以及v1.0名次榜快照。TokenArena是一种方法论而非单一排名;我们公布完整的来源信息与局限性,并欢迎外部复现。

Token Arena:统一AI推理能耗与认知的持续性基准:论文配图
图 1:Token Arena 管道。三个测量循环——探测(连续)、评估(每日和每周)和能源/定价(每日)——针对实时端点独立运行。所有测量结果都写入以端点身份和探测条件为关键的时间序列存储中。每晚根据工作负载预设重新计算综合分数。