返回

阿里巴巴

Qwen3.7-Plus

推理模型
实战排名#31SQBench · 45 个模型

模型分析

Qwen3.7-Plus 是一款闭源推理模型,支持文本、图像、视频输入、文本输出,拥有 100 万 Token 上下文窗口,定价在同类参评模型中处于低位。

在 SQBench 实战能力评测中,该模型得分为 45.3,排名处于中游;模型可靠度为 82.7%,幻觉率为 7.5%;完成整套评测共消耗 28.2M Token、12.2 小时和 6.10美元。

分项能力层面,动态代码逻辑和数据分析是相对优势;鲁棒性与边界和深度研究表现相对偏弱。

查看《Qwen3.7-Plus 实战能力评测报告》 ↗

技术参数

推理模式
推理
输入模态
文本、图像、视频
输出模态
文本
上下文长度
1M
发布日期
2026-05
实战能力#31/45

45.3

幻觉率#38/45

7.5%

评测成本#20/45

6.1$

完成耗时#24/45

12.2h

Token 消耗#17/45

28.2M

实战能力

基于任务通过情况衡量模型在真实业务任务中的稳定交付表现,越高表示可稳定完成的任务比例越高。

细分能力

从基础执行、复合工作流和业务场景三个层面,比较模型在不同类型实战任务中的表现。

行是能力、列是模型,单元格是已发布的任务通过率,缺失值以破折号显示。
能力 / 模型
L1 原子能力
指令遵循
长文本推理
动态代码逻辑
鲁棒性与边界
L2 复合技能
数据分析
软件工程
深度研究
办公协作
L3 业务场景
金融
工业
医疗
政务
点击色块查看明细 · 缺失数据为 —通过率 0%100%

成本效率

展示模型完成 SQBench 实战任务所需的评测成本、完成耗时和 Token 消耗,用于辅助判断规模化使用成本。

评测成本(USD) · 数值越低,投入越少

左右滑动查看完整榜单

Qwen3.7-Plus阿里巴巴
实战能力
45.3%
评测成本
$6.1
完成耗时
12.22 小时
Token 消耗
28.2M

性价比

对比模型实战能力与可靠度、评测成本、完成耗时和 Token 消耗,辅助判断不同模型的部署价值。

实战能力 vs

左右滑动查看完整图表

能力较高可靠度较低能力较高可靠度较高能力较低可靠度较低能力较低可靠度较高1020304050607065%70%75%80%85%90%95%实战能力(%)可靠度(%)

虚线为筛选范围内全部模型的中位数:实战能力 51.36%,可靠度 83.16%。浅色区域仅作相对比较。

评测结果