SQBench

SQBench聚焦大模型在真实业务场景中的实战表现,围绕任务交付、风险边界与成本效率等维度,为模型选型、能力对比和部署决策提供参考依据。

实战能力

基于任务通过情况衡量模型在真实业务任务中的稳定交付表现,越高表示可稳定完成的任务比例越高。

细分能力

从基础执行、复合工作流和业务场景三个层面,比较模型在不同类型实战任务中的表现。

行是能力、列是模型,单元格是已发布的任务通过率,缺失值以破折号显示。
能力 / 模型
L1 原子能力
指令遵循
长文本推理
动态代码逻辑
鲁棒性与边界
L2 复合技能
数据分析
软件工程
深度研究
办公协作
L3 业务场景
金融
工业
医疗
政务
点击色块查看明细 · 缺失数据为 —通过率 0%100%

成本效率

展示模型完成 SQBench 实战任务所需的评测成本、完成耗时和 Token 消耗,用于辅助判断规模化使用成本。

评测成本(USD) · 数值越低,投入越少

左右滑动查看完整榜单

性价比

对比模型实战能力与可靠度、评测成本、完成耗时和 Token 消耗,辅助判断不同模型的部署价值。

实战能力 vs

左右滑动查看完整图表

能力较高可靠度较低能力较高可靠度较高能力较低可靠度较低能力较低可靠度较高45505560657070%75%80%85%90%95%实战能力(%)可靠度(%)

虚线为筛选范围内全部模型的中位数:实战能力 52.4%,可靠度 83.94%。浅色区域仅作相对比较。

评测结果