首页
AI技术追踪
Daily Paper
SQBench
沙丘智库
关于沙丘
关于沙丘
专栏文章
评测方法
更新日志
首页
AI技术追踪
Daily Paper
SQBench
沙丘智库
关于沙丘
关于沙丘
专栏文章
评测方法
更新日志
更新日志
跟踪 SQBench、模型评测和沙丘社区内容的最新发布。
全部
模型评测
公告
社区洞察
2026-09-28
社区洞察 · 9月28日
“为什么企业AI需要本体上下文层?”发布
本体是提高AI准确性、降低应用成本的关键基础
2026-09-24
社区洞察 · 9月24日
“OpenAI卷入价格战!GPT-6 Sol与Luna实战能力评测”发布
OpenAI降价后的新模型,能打过千问、DeepSeek和智谱吗?
社区洞察 · 9月24日
“Grok的性价比,国产模型不答应”发布
Grok 4.7实战能力评测
2026-09-23
模型评测 · 9月23日
GPT-6 Luna (Max)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
模型评测 · 9月23日
GPT-6 Sol (Max)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
社区洞察 · 9月23日
“又强又便宜!Claude Opus 5.5登顶SQBench”发布
向行业场景进发!
模型评测 · 9月23日
Claude Opus 5.5 (Max)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
2026-09-22
社区洞察 · 9月22日
“平价分析师来啦!MiMo-V2.6-Pro实战能力评测”发布
和GLM-5.3“扳手腕”
模型评测 · 9月22日
Grok 4.7 (Xhigh)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
模型评测 · 9月22日
MiMo-V2.6-Pro评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
2026-09-21
社区洞察 · 9月21日
“上桌?Step 5 Preview实战能力评测”发布
阶跃星辰能否进入国产主流模型竞争行列?
2026-09-20
模型评测 · 9月20日
Step 5 Preview (High)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
社区洞察 · 9月20日
“GLM-5.3-FlashX,新晋性价比之王”发布
2折费用,3倍速度!
2026-09-19
社区洞察 · 9月19日
“让豆包新模型干了24小时,效果却不如旧模型?”发布
Doubao Seed 2.1 Pro-260915实战能力评测
模型评测 · 9月19日
GLM-5.3-FlashX (Max)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
模型评测 · 9月19日
GLM-5.3-Flash (Max)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
模型评测 · 9月19日
GLM-5.3 (Max)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
2026-09-18
社区洞察 · 9月18日
“追踪2142项AI技术动态后,我们发现最值得关注的不是新模型”发布
Harness、真实工作评测与Agent交付正在成为新的技术重点
模型评测 · 9月18日
Doubao-Seed-2.1-pro-260915 (High)评测结果上线
实战能力、可靠度、成本与模型分析页面已更新
2026-09-17
社区洞察 · 9月17日
“DeepSeek真能“斩杀”千问和豆包吗?”发布
三款模型实战能力实测结果揭晓!
第 1 / 4 页
下一页