首页
AI技术追踪
Daily Paper
SQBench
沙丘智库
关于沙丘
关于沙丘
专栏文章
评测方法
更新日志
首页
AI技术追踪
Daily Paper
SQBench
沙丘智库
关于沙丘
关于沙丘
专栏文章
评测方法
更新日志
更新日志
跟踪 SQBench、模型评测和沙丘社区内容的最新发布。
全部
模型评测
公告
社区洞察
2026-09-28
社区洞察 · 9月28日
“为什么企业AI需要本体上下文层?”发布
本体是提高AI准确性、降低应用成本的关键基础
2026-09-24
社区洞察 · 9月24日
“OpenAI卷入价格战!GPT-6 Sol与Luna实战能力评测”发布
OpenAI降价后的新模型,能打过千问、DeepSeek和智谱吗?
社区洞察 · 9月24日
“Grok的性价比,国产模型不答应”发布
Grok 4.7实战能力评测
2026-09-23
社区洞察 · 9月23日
“又强又便宜!Claude Opus 5.5登顶SQBench”发布
向行业场景进发!
2026-09-22
社区洞察 · 9月22日
“平价分析师来啦!MiMo-V2.6-Pro实战能力评测”发布
和GLM-5.3“扳手腕”
2026-09-21
社区洞察 · 9月21日
“上桌?Step 5 Preview实战能力评测”发布
阶跃星辰能否进入国产主流模型竞争行列?
2026-09-20
社区洞察 · 9月20日
“GLM-5.3-FlashX,新晋性价比之王”发布
2折费用,3倍速度!
2026-09-19
社区洞察 · 9月19日
“让豆包新模型干了24小时,效果却不如旧模型?”发布
Doubao Seed 2.1 Pro-260915实战能力评测
2026-09-18
社区洞察 · 9月18日
“追踪2142项AI技术动态后,我们发现最值得关注的不是新模型”发布
Harness、真实工作评测与Agent交付正在成为新的技术重点
2026-09-17
社区洞察 · 9月17日
“DeepSeek真能“斩杀”千问和豆包吗?”发布
三款模型实战能力实测结果揭晓!
2026-09-16
社区洞察 · 9月16日
“DeepSeek V4.1 Flash真的超越V4 Pro了吗?”发布
完全替代V4 Pro ?
2026-09-15
社区洞察 · 9月15日
“本周AI技术跟踪:失效信息将影响Agent记忆可靠性(W37)”发布
识别和解读本周值得关注的技术变化
2026-09-14
社区洞察 · 9月14日
“研究精选:13份报告,聚焦企业AI的成本、落地与组织能力”发布
涵盖AI编程、智能体治理、企业本体、交付模式与创新实践
2026-09-11
社区洞察 · 9月11日
“英伟达给AI加上长期记忆,Agent要拼的不只是智商了”发布
英伟达近期公开了一项基于NemoClaw的记忆型Agent实践
2026-09-10
社区洞察 · 9月10日
“大厂的本体是一回事吗?”发布
本体到底是一种新产品,还是知识图谱换了个名字?
2026-09-09
社区洞察 · 9月9日
“海外AI Coding Agent产品定价研究:Claude Code、Codex、Cursor和GitHub Copilot”发布
定价模式正从固定席位费转向按量计费
2026-09-08
社区洞察 · 9月8日
“Palantir交付模式研究:竞争优势、运行机制与中国企业启示”发布
Palantir真正的护城河可能不是软件
2026-09-03
社区洞察 · 9月3日
“企业Harness实践深度调研:技术成熟度、实践分化与建设路径”发布
企业Harness,进入兑现期
2026-08-31
社区洞察 · 8月31日
“测试智能体驱动质量工程范式革新,腾讯、小红书、58同城实践案例”发布
腾讯、小红书、58同城等头部企业测试智能体落地实践
2026-08-25
社区洞察 · 8月25日
“Data Agent如何企业级落地?邮储银行、恒丰银行、得物、淘宝等实践案例”发布
告别传统BI:Data Agent驱动企业数据分析范式革新
第 1 / 2 页
下一页