作者|沙丘智库研究团队
来源|沙丘社区(www.shaqiu.cn)
OpenAI也开始认真卷价格了。
9月22日,OpenAI发布GPT-6 Sol和GPT-6 Luna。两款模型采用与Astra相近的训练方法,主打更低的使用成本。Sol每百万Token的输入、输出价格分别为2美元、10美元;Luna更低,只需0.1美元、0.5美元。按照官方的说法,缓存和推理效率的改善,为这轮降价提供了条件。
官方公布的成绩也不错。在复杂软件工程测试DeepSWE v1.1中,Sol和Luna的Max配置分别取得68.8%和66.6%。在业务工作流测试AutomationBench中,Sol的xhigh配置取得33.2%,高于Astra的low配置30.3%,任务成本也更低。
沙丘社区也已完成两款模型的SQBench实战能力评测,成绩现已上线。GPT-6 Sol(Max)的SQBench得分为52.13%,GPT-6 Luna(Max)为43.73%。截至9月23日,二者分别位列45个已发布模型中的第11位和第34位。

图1:SQBench官网截图,OpenAI近期发布的系列模型评测结果
价格确实降下来了,但Sol和Luna与Astra还差多少?面对已经很便宜的国产模型,它们又有多大胜算?
01
对比Astra:价格降下来了,能力到底行不行?
先把三款模型放在同一张表里。
SQBench指标 | GPT-6 Astra(Max) | GPT-6 Sol(Max) | GPT-6 Luna(Max) |
SQBench得分 | 64.27% | 52.13% | 43.73% |
L1原子能力通过数 | 68/100 | 59/100 | 52/100 |
L2复合技能通过数 | 43/60 | 35/60 | 29/60 |
L3业务场景通过数 | 23/60 | 16/60 | 13/60 |
三款均为Max配置,分项数字为通过任务数/任务总数。
Sol比Astra低12.14个百分点,Luna则低20.54个百分点。L1、L2、L3三个层级的通过数也都少于Astra,综合能力仍有差距。
分项来看,Sol的代码逻辑和办公协作表现较好,Luna的软件工程成绩也不错。
代码逻辑是最明显的一项。在L1动态代码逻辑的25项任务中,Sol与Astra均全部通过,Luna也通过23项,通过率达到92%。在这组测试中,Sol用更低的费用追平了Astra的成绩。
L2复合技能更接近实际工作,四个分项的结果如下。
L2复合技能 | Astra(Max) | Sol(Max) | Luna(Max) |
数据分析 | 12/15 | 8/15 | 7/15 |
软件工程 | 13/15 | 10/15 | 11/15 |
深度研究 | 8/15 | 6/15 | 3/15 |
办公协作 | 10/15 | 11/15 | 8/15 |
Sol在办公协作中通过11项,比Astra多1项;Luna在软件工程中通过11项,比Sol多1项。虽然只差一道题,还不足以判断谁能稳定领先,但这也说明,便宜的模型并非每一项都弱。如果工作主要集中在这些任务上,可以先测试低价模型能否胜任,再决定是否需要为旗舰多花钱。
Astra在数据分析和深度研究上仍然领先。尤其是Luna,软件工程通过了11项,深度研究却只通过3项。同一款模型,在不同任务上的表现可以相差很大,不能根据代码成绩判断它是否适合做研究。
长文本推理的成绩更低:Astra通过10/25,Sol为4/25,Luna为5/25。三款模型在这项测试上都还有不足。上下文窗口再长,模型也可能漏掉材料中的关键条件,或无法正确关联分散的证据。
L3行业业务任务也拉开了差距。60项任务中,Astra通过23项,Sol为16项,Luna为13项。其中,Sol的金融任务仅通过1/15;Luna的15项工业任务均未完整通过,虽然完成了部分要求,但还没有达到通过标准。
从这些结果看,Sol和Luna可以作为部分日常任务的低价选择,但用于复杂研究和行业业务时,还需要逐项验证。省下调用费之后,如果又增加了大量人工检查和返工,就未必划算。
与上一代相比,新Sol也没有在本轮测试中取得更高的总分。GPT-5.6 Sol(Max)的成绩为54.60%,新Sol为52.13%,但整轮费用比旧记录低约65.5%。单轮测试还不能据此判断新模型全面退步,不过,这次Sol最明显的改善是费用下降,综合成绩并未提高。
02
OpenAI加入价格战,能打过千问、DeepSeek和智谱吗?
与Astra相比,两款模型便宜了很多。Sol的输入、输出单价均比Astra低80%,Luna则均低99%。
在SQBench的完整测试中,Sol和Luna的费用分别比Astra低约79.0%和98.4%。对于已经使用OpenAI模型的团队,如果日常任务用Sol或Luna就能完成,调用费用便有大幅下降的空间。
不过,判断性价比,还得和同样便宜的国产模型比一比。
Sol比千问略占优势,但还有更便宜、得分更高的国产模型。
模型配置 | SQBench得分 | 评测费用相较Sol |
GPT-6 Sol(Max) | 52.13% | 比较基准 |
Qwen3.8-Max(Xhigh) | 51.33% | 高约7.4% |
GLM-5.3(Max) | 56.06% | 低约16.8% |
DeepSeek-V4-Pro-0813(Max) | 51.40% | 低约72.3% |
GLM-5.3-FlashX(Max) | 54.60% | 低约84.0% |
Sol比Qwen3.8-Max高0.80个百分点,整轮费用也略低。在这两个已测配置之间,Sol确实做到了分数更高、费用更低。
但与智谱的模型相比,Sol就没有这种优势了。GLM-5.3得分更高、费用更低;FlashX同样得分更高,而Sol的评测费用是它的约6.3倍。DeepSeek-V4-Pro-0813虽然比Sol低0.73个百分点,费用却不到Sol的三成。
所以,Sol能给千问带来竞争压力,但还谈不上在性价比上领先这些国产对手。
Luna已经很便宜,但国产模型还能做到费用更低、得分更高。
模型配置 | SQBench得分 | 评测费用相较Luna |
GPT-6 Luna(Max) | 43.73% | 比较基准 |
Qwen3.8-Flash(Xhigh) | 40.00% | 高约23.3% |
GLM-5.3-Flash(Max) | 49.73% | 低约17.4% |
DeepSeek-V4-Flash(High) | 47.07% | 低约58.2% |
DeepSeek-V4-Flash(Max) | 36.80% | 低约55.2% |
以上两表均为SQBench已发布配置的测试记录,保留各自推理档位;它们反映具体配置的实测结果,不代表各模型的全部可选档位。费用比较分别以Sol、Luna为基准,按各次运行的记录计算,并非按今天的价格重新计费。
Luna的得分和费用同样优于Qwen3.8-Flash,但GLM-5.3-Flash和DeepSeek-V4-Flash的High配置都比Luna得分高。费用上,Luna分别是这两款配置的约1.2倍和2.4倍。这里也列出了DeepSeek-V4-Flash的Max成绩:它反而低于High配置。这说明,实际选型时还要比较推理档位,不能默认开到最高档就能得到更好的结果。

图2:SQBench官网截图。
从本轮测试看,Sol和Luna都能与国产模型比较性价比了。其中,千问面临直接压力;智谱和DeepSeek则仍各有优势。OpenAI的降价增加了选择,国产模型的费用优势也仍然存在。
企业还需要关注模型在完成任务时到底用了多少Token。
这次Luna消耗约3071万Token,比Sol的约2294万多33.9%,最后的费用却低得多。因此,比较费用时,既要看Token单价,也要看消耗量和缓存使用情况。实际业务还会产生重试、人工验收和返工成本,只有把这些算在一起,才能判断换用便宜模型究竟省了多少钱。
Astra、Sol和Luna正好呈现了这种分工:Astra的综合成绩更高,Sol和Luna以较低费用完成其中一部分工作。国产模型也在争夺这些日常调用需求。OpenAI这次降价后,国产厂商需要继续提高同等预算下的任务表现,OpenAI也得证明自己的低价模型足够好用。
同等能力越来越便宜,已经是大模型市场的持续变化。这轮价格竞争对用户最直接的好处,是日常工作有了更多便宜的模型可选。选模型时,最终要比较的是完成同一项工作需要花多少钱、返工多少次。Sol和Luna已经有资格参与这场竞争,但从SQBench的评测结果看,国产模型仍然很能打。
更多AI研究内容可前往【沙丘智库小程序】搜索查阅