作者|沙丘智库研究团队

来源|沙丘社区(www.shaqiu.cn)

Gemini 3.6 Flash刚一发布,网络上一边是“爆省65%Token”,另一边是“Google史上最差模型”。

都挺热闹,其实这些言论“对”也“不对”!

Google对3.6 Flash的定位其实很克制:不是旗舰,不负责证明Gemini又站上了智力之巅,而是面向大规模Agent的“主力干活模型”。它要解决的,是代码少改几遍、工具少调几次、任务更快跑完。

问题也随之而来:一个没有明显变聪明的模型,真能把工作做得更好吗?

沙丘社区SQBench对Gemini 3.6 Flash(High)的实战能力进行了深度评测,执行了220项真实工作任务、消耗5947万Token、耗时7.7小时之后,答案出来了:

能。而且进步不小。但成本不能只看Token单价!

01

智力没有涨,工作能力涨了11.3分

先看两份看似打架的成绩单。

Artificial Analysis给Gemini 3.6 Flash的智力指数是50分,与3.5 Flash完全相同。它没有在这套综合智力测试上跨出下一步。

但在SQBench中,3.6 Flash(High)的实战能力得分从前代的40.5分升至51.8分,提高11.3分,位列当前29个参评模型第 5。

这两个结论并不矛盾。

传统基准更像考试:看模型会不会。SQBench更像上班:把资料、工具、约束和交付物一起摆在面前,看它最后能不能交差。

3.6 Flash没有突然掌握更多知识,但它变得更利索了。Artificial Analysis的测试中,它完成一项任务的平均时间从2.7分钟缩短到1.3分钟;Google披露其输出Token平均减少17%,在DeepSWE特定任务中最多减少65%。

所以这次升级的关键词不是“更聪明”,而是少绕路

对于Agent开发者来说,这可能比智商多一两分更有用。工作环境中最怕的,往往不是模型不会,而是它会做,却在工具之间反复横跳,烧完Token还没留下交付物。

02

代码能力强,但偶尔会倒在“最后一步”

Gemini 3.6 Flash最硬的一块,是代码。

它在SQBench动态代码逻辑中拿到96分,与GPT-5.6 Sol(Max)、Claude Opus 4.8(Max)并列最高;软件工程任务通过率73.3%,也是它四项复合技能中最好的一项。

比如在我们一项生产数据管道故障任务中,测试要求模型修复加权计算中的除零错误,同时保持函数签名、注释、两位小数逻辑和主程序不变。3.6 Flash找到问题后,只增加了两行守卫代码,空列表和总权重为零时返回0.0;随后主动运行测试,全部通过。

干净、克制,没有顺手重构其他部分。

在另一项LLM推理服务内存泄漏任务中,它又准确解释了KV Cache的Copy-on-Write和引用计数,引用日志中的具体Block ID,补齐验证脚本,并通过模糊测试。这个过程更接近真实工程,而不是从零生成一个看起来能跑的Demo。

但它也暴露了一个很“Agent”的问题:事情想明白了,不代表事情交付了。

在一个API Gateway更新任务中,它已经找到了生效中的安全策略、识别了正确的密钥前缀,也从备份中筛出了生产密钥。逻辑基本完成,可直到任务终止,它都没有生成要求的结果。

这项任务最终是0分。

只关注“编码能力”的分数或排名其实意义不大。Agent的合格线不是“推理过程大致正确”,而是文件写了、测试跑了、格式对了、结果真的能被下一个系统接住。

03

幻觉只有4.2%,却仍有近一半任务没通过

3.6 Flash的总体幻觉率是4.2%,表现不错;可靠度为82.6%。但它的实战通过率只有51.8%。

哪里出了问题?

大量失败并不是因为胡说,而是因为少做一步、漏掉一个字段,或者在错误的地方消耗太久。

一项长文本的任务执行数据显示,它正确完成了行业排序、原始数量、差值、倍数、例外排除和因果提醒,完成度达到92.86%。但因为漏掉归一化结果,依然没有越过SQBench的完整交付线。

另一项服务器成本分摊任务里,模型发现缺少企业内部费率。本来应该停下来向负责人索取输入,它却连续31步搜索目录、系统文件和环境变量,最后耗尽预算,没有交出报告。

3.6 Flash没有硬乱编数字,也没有明显幻觉。

就是没把活干出来。

这组结果提醒企业:“不胡说”只是安全底线,不是生产力指标。 如果系统只监控幻觉率,却不检查交付物、约束覆盖和任务闭环,会高估模型真正能接走的工作量。

3.6 Flash 100万token的上下文长度也需要这样看。窗口很大,但SQBench长文本推理只有24分

能把材料塞进去,和能从材料里找准关系,是两回事。

04

输出降价了,执行工作却贵了10.5%

Google把3.6 Flash的输出价格从每百万Token9美元降到7.5美元。Artificial Analysis评测结果中显示平均单任务成本下降约18%。

可在SQBench的评测结果中,3.6 Flash花了81.77美元,3.5 Flash是74.02美元——总账反而上涨约10.5%?

拆开看,真相更有意思:

• 回答成本从9.77美元降至8.88美元;

• 推理成本从23.46美元降至20.96美元;

• 输入成本却从40.78美元升至51.93美元。

Google宣传的降价没有错。错的是把“每百万Token更便宜”,直接理解为“企业总成本一定更低”。

真实Agent会反复读取上下文、工具结果和历史状态。输出省下来的钱,很可能又被输入端吃回去。更别提一次漏交文件造成的重跑,以及开发者人工检查、纠错和补交付。

模型单价,不是任务成本;任务成本,也还不是业务成本。

05

写在最后

Gemini 3.6 Flash很难用“好”或者“不好”两个字概括。

SQBench中的220项工作,它完成了114项,排在当前参评模型第五;代码题几乎全部拿下,长文本却只完成四分之一;Google下调了输出价格,完整任务的账单反而多了一成。

它没有成为一个更高分的考生。但在不少任务上,它确实变成了一个动作更快、返工更少的执行者。只是偶尔会在所有工作都做完以后,忘了按下“提交”。

对企业来说,这个缺点并不致命。前提是你知道它会在哪里忘,并提前把验收、追问和人工门禁装好。

模型已经越来越会干活了。

接下来真正拉开差距的,早已不只是哪个模型更聪明了,而是谁先把“怎样才算把活干完”定义清楚。


关于SQBench

SQBench是沙丘社区推出的大模型实战能力评测基准,区别于传统“做题式”测试,它通过标准化真实工作任务和统一评测条件,综合考察模型的任务交付能力、风险边界与资源消耗。