小米
MiMo-V2.5
推理模型实战排名#22SQBench · 45 个模型
模型分析
MiMo-V2.5 是一款开源推理模型,支持文本、图像、视频、音频输入、文本输出,拥有 100 万 Token 上下文窗口,定价在同类参评模型中处于低位。
在 SQBench 实战能力评测中,该模型得分为 48.5,排名位于前列;模型可靠度为 79.0%,幻觉率为 6.4%;完成整套评测共消耗 32.9M Token、8.3 小时和 1.40美元。
分项能力层面,动态代码逻辑和软件工程是相对优势;鲁棒性与边界和办公协作表现相对偏弱。
查看《MiMo-V2.5 实战能力评测报告》 ↗技术参数
- 推理模式
- 推理
- 输入模态
- 文本、图像、语音、视频
- 输出模态
- 文本
- 上下文长度
- 1M
- 总参数量
- 310B
- 激活参数量
- 15B
- 发布日期
- 2026-04
实战能力#22/45
48.5
幻觉率#28/45
6.4%
评测成本#3/45
1.4$
完成耗时#12/45
8.3h
Token 消耗#23/45
32.9M
实战能力
基于任务通过情况衡量模型在真实业务任务中的稳定交付表现,越高表示可稳定完成的任务比例越高。
细分能力
从基础执行、复合工作流和业务场景三个层面,比较模型在不同类型实战任务中的表现。
| 能力 / 模型 | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| L1 原子能力 | ||||||||||||||||||||
| 指令遵循 | ||||||||||||||||||||
| 长文本推理 | ||||||||||||||||||||
| 动态代码逻辑 | ||||||||||||||||||||
| 鲁棒性与边界 | ||||||||||||||||||||
| L2 复合技能 | ||||||||||||||||||||
| 数据分析 | ||||||||||||||||||||
| 软件工程 | ||||||||||||||||||||
| 深度研究 | ||||||||||||||||||||
| 办公协作 | ||||||||||||||||||||
| L3 业务场景 | ||||||||||||||||||||
| 金融 | ||||||||||||||||||||
| 工业 | ||||||||||||||||||||
| 医疗 | ||||||||||||||||||||
| 政务 |
成本效率
展示模型完成 SQBench 实战任务所需的评测成本、完成耗时和 Token 消耗,用于辅助判断规模化使用成本。
评测成本(USD) · 数值越低,投入越少
左右滑动查看完整榜单
MiMo-V2.5小米
- 实战能力
- 48.5%
- 评测成本
- $1.4
- 完成耗时
- 8.31 小时
- Token 消耗
- 32.89M
性价比
对比模型实战能力与可靠度、评测成本、完成耗时和 Token 消耗,辅助判断不同模型的部署价值。
左右滑动查看完整图表
虚线为筛选范围内全部模型的中位数:实战能力 51.36%,可靠度 83.16%。浅色区域仅作相对比较。