网易首页 > 网易号 > 正文 申请入驻

一周实操 GPT-5.6,综合能力客观测评报告

0
分享至

系列五 · 第9篇

ChatGPT深度测评GPT-5.6到底行不行?上手一周的真实感受

太阳·地球·月亮三档模型全解析
编程霸榜但实测翻车?Codex并入ChatGPT体验如何

14款主流AI软件深度测评 · 国外篇



先别急着往下翻——这篇文章我花了一周真刀真枪地用了GPT-5.6,踩过的坑、发现的惊喜全写在这儿了。觉得有用的话,点个关注,以后每篇深度测评你都不会错过。

先说句大实话

写ChatGPT这篇文章,其实挺难的。

不是因为信息不够——恰恰相反,GPT-5.6刚发布两周,网上的评测文章已经满天飞了。难的是怎么讲点真东西,不是把官方通稿翻译一遍就当测评了。

我认真用了差不多一周,Sol、Terra、Luna三个版本都切着用过,Codex合并进ChatGPT的新桌面端也装上了。先说一个总的感受吧:GPT-5.6确实很强,但发布日那天的"吊打一切"情绪,和真正上手之后的体感,完全不是一回事。

如果你期待的是那种"ChatGPT还是第一"的定心丸,这篇文章可能让你不太舒服。但如果你想知道GPT-5.6在中国用户手里到底好不好用、值不值——那咱们可以接着往下聊。

先看阵容:太阳·地球·月亮,三兄弟齐上阵

7月10号凌晨,OpenAI搞了个线上发布会,正式推出GPT-5.6家族。三个版本,名字起得挺有诗意:

Sol(太阳)——旗舰款,专攻复杂编码、科研、网络安全。输入5美元/百万token,输出30美元。对标Claude Fable 5

Terra(地球)——均衡款,综合性能对标上一代GPT-5.5,价格只有5.5的一半。输入2.5美元,输出15美元

Luna(月亮)——轻盈款,主打低成本+快速响应。输入1美元,输出6美元。免费用户能用

命名逻辑很简单:太阳最亮但也最费能量,月亮省电但没那么亮,地球居中。对用户来说就是三道选择题——要最强的、要均衡的、还是要便宜的。

除了模型本身,这次发布会还有两个大动作:Codex正式并入ChatGPT桌面应用,以及推出了ChatGPT Work——一个对标Claude Cowork和WorkBuddy的智能体工具。

说白了,OpenAI想让你在一个App里完成对话、写代码、跑复杂任务三件事。不用再左边开个ChatGPT网页、右边开个Codex客户端来回切了。



Sol/Terra/Luna三档模型,从5美元到1美元输入价格全覆盖

编程能力:AA排行榜80分登顶,但实战有翻车

先聊GPT-5.6最被吹的一点——编程。

官方的数据确实漂亮。在Artificial Analysis Coding Agent Index上,Sol(max推理强度)拿到80分,比Claude Fable 5高了2.8分,而且只用了不到一半的输出token,耗时少一半,成本低三分之一。Terminal-Bench 2.1上也刷新了记录,Ultra模式拿到91.9%。

看这些数字,你会觉得GPT-5.6已经把Fable 5按在地上摩擦了。

但真实情况要复杂得多。说说我看到的几个翻车案例。

最出名的一个:开发者Matt Shumer让Sol跑任务,它居然执行了一个类似rm -rf的命令,把他Mac上的文件全删光了。这事在Twitter上传得挺广,不是段子,是真实的。

还有一个更硬核的数据:SWE-Bench Pro上,Fable 5自报大约80%,Sol只有64.6%。OpenAI还专门发文质疑SWE-Bench Pro有大量"坏题"——这个动作本身就说明了一些问题。

知名开发者Simon Willison的评价更实在:Sol确实能干活,但在他常做的复杂编码任务上,目前还没觉得它比Fable 5更好。

我的体感也是类似的——Sol在需要持续协作的编码任务上确实更顺手,多轮对话的连续性比Fable 5好。但让它一次性解决硬核问题、不出bug、不删文件,稳定性方面Fable 5还是更让人放心。

用一句话概括:Sol像是那个灵感多、干活快但偶尔出昏招的同事,Fable 5是那个慢一点但从不搞砸的老法师。



AA Coding Agent Index 80分登顶,但SWE-Bench Pro被Fable 5甩开15个点

如果你用Sol做编程,先把推理强度调到medium。Max和Ultra模式烧Token太快,而且Ultra模式下子智能体会默认继承Ultra,四五个Agent一起烧,账单很酸爽。

Codex并入ChatGPT:一个App搞定一切

这次合并是很多人期待已久的。原来Codex是独立App,做复杂编程项目得在ChatGPT和Codex之间来回倒。现在好了,新版ChatGPT桌面应用里有三种模式:

Chat模式——就是原来的聊天对话,日常问答、查资料、写文案都在这里

Work模式——新增的智能体模式,可以连续跑几小时的复杂工作流。你发个任务,它自己规划、执行、改错、交付,不需要你盯着

Codex模式——原来的编程专用工作区,写代码、调bug、跑测试都在这里

三个模式之间还能互通。你在Chat里查到的东西可以直接拖进Codex当参考资料,Codex跑任务时有不懂的可以随时切到Chat请教。这种无缝感,用过之后就回不去了。

另外几个小细节也挺实用:

桌面应用能直接访问你电脑的本地文件了,不用先手动上传

能读取浏览器标签页的内容,你让它总结当前网页,它能直接看到你在看什么

新增了Sites功能——你让它做一个东西,它直接生成一个网页部署到云端,给你一个公开链接。不懂技术的人也能一句话建站

预览区现在能直接编辑了,生成的文档不满意,原地改,不用导出再编辑

不过得说句实话——目前新客户端bug还不少。英文夹中文混着输出、任务跑完界面没显示结果、文件下载偶尔卡住。这些不是模型的问题,是产品的锅,后续更新应该会修。



Chat+Work+Codex三模式合一,一个App搞定所有事

价格:不算贵,但"省流"是个伪命题

GPT-5.6的定价策略,我觉得是这次发布最值得聊的部分。

先看数字:Sol输入5美元/百万token、输出30美元。跟Fable 5比,输入只要一半,输出便宜40%。跟自家上一代GPT-5.5比,Sol和5.5同价但性能更强。Terra对标5.5的性能只要半价。

表面上看,OpenAI在打"加量不加价"的牌。但事情没这么简单。

第一个坑:Ultra模式。Sol默认并行启动4个子智能体(最高16个),每个都是Ultra推理强度。如果你一上来就把effort拉到Ultra,四个Agent一起跑,烧Token的速度是你预期的好几倍。有人第一天就发现账单炸了。OpenAI的实际意思是:以更高的Token消耗换取更强结果——但你得自己算这笔账划不划算。

第二个坑:Terra号称"省流版",但其实并不怎么省。它的Token消耗量对标GPT-5.5,只是价格便宜了。实际做同样的任务,Terra的Token消耗量往往比竞品高。

第三个坑:缓存写入按1.25倍费率计费。虽然缓存读取有90%折扣,但对于长上下文任务,首次写入的成本比你想的要多一些。

那到底贵不贵?分情况看。如果你用Sol做简单的摘要改写、日常聊天,性价比不如Grok 4.5或国产模型。但如果你让它做一次复杂的研究任务——先检索资料、分析数据、生成图表、写成报告——一次调用能顶之前好几个小时的活,那100元的输出单价就不算贵。

另外提一句速度。Sol在Cerebras上最高可以跑到每秒750个token,差不多每秒五六百个汉字。国内用户受网络环境影响肯定达不到这个数,但整体响应速度确实比GPT-5.5有明显的提升。



Sol/Terra/Luna三档定价,比Fable 5便宜40%,但Ultra模式会悄悄吃掉预算

中国用户最真实的几个槽点

优点聊完了,说说这段时间用得最难受的地方。有几条可能你也会有同感。

第一,中文表达"英译中"感太强了。GPT-5.6的中文自然度在主流模型里得分最低(7.5/10),比国产模型低了快两个档次。不是它说得不对,而是"不地道"。比如它帮你写个文案,逻辑没问题,但读起来就是一股翻译腔——"在我们的日常生活中,人工智能正在发挥着越来越重要的作用"这种句式,一看就是机器写的。

第二,做简单任务时"想太多"。你问它"怎么写请假条",它给你分析请假理由的心理学原理、上司的期望管理、以及请假对公司文化的影响。问一杯咖啡的推荐,它能从产地、烘焙度、冲泡方式写到咖啡豆贸易对南美经济的影响。强是强,但对普通用户来说太啰嗦了。

第三,国内访问是个绕不过去的门槛。这个就不用多说了——需要科学上网。虽然这不是OpenAI的问题,但对国内用户来说,这直接决定了ChatGPT能不能成为你的主力工具。访问不稳定的时候,什么排行榜第一都没意义。

第四,稳定性还有待加强。发布会后第一波真实反馈里,稳定性和可控性成了最大的问题。rm -rf删文件只是个极端案例,更常见的是:模型跑完了界面没显示结果、英文夹着中文一起喷出来、长时间任务跑到一半出bug没人管。这些问题不是模型能力不够,而是产品化还不够成熟。

第五,用户的忠诚度其实很低。OpenAI自己可能也感觉到了这一点。GPT-5.6发布后,他们会频繁给用户重置配额(有点像网游发补偿)。短期看这是挽留用户的手段,长期看说明用户切换成本很低——哪个模型好用用哪个,没有谁非你不可。



中文翻译腔重、简单问题想太多、国内访问门槛高

月活超11亿但首次跌破50%,老大的位子没那么稳了

看几个数字感受一下ChatGPT的体量:

月活用户:超过11亿(Sensor Tower 2026年6月数据),史上最快破10亿的应用

年化收入:超过250亿美元,月入约20亿美元

付费用户:超过5000万个人订阅 + 900万企业用户

广告收入:年化ARR 1亿美元(今年2月才开始做广告)

但有个数据更值得关注:ChatGPT的全球市场份额在5月底首次跌破了50%,降到46.4%。Google Gemini以27.7%逼近,Claude占10.3%。

更重要的是,用户在几个AI助手之间切换的行为越来越普遍。特定事件甚至会加速这种迁移——今年2月OpenAI跟美国国防部签约后,ChatGPT的卸载量激增295%。用户没有你想象的那么忠诚。

OpenAI在商业化的路上也在加速。2月开始在ChatGPT里投广告,目前已有17%的日活用户看到广告。不过说实话,目前的广告产品还很初级,定位、测试、数据报告都比谷歌差得远。有广告代理公司实测发现,ChatGPT广告的点击率明显低于谷歌广告。

OpenAI给的长期目标挺吓人的——到2030年广告收入1000亿美元。但行业分析师普遍觉得这不太现实,毕竟整个聊天机器人广告市场今年还不到10亿。



11亿月活全球第一,但市占率首次跌破50%,Gemini正在逼近

怎么选:ChatGPT vs Claude vs Grok vs 国产模型

说了这么多,落到实际选择上,给你一个参考:

选ChatGPT(GPT-5.6 Sol)如果你:需要处理复杂编码任务、网络安全、科研分析,而且能接受国内访问门槛。它的Agent长程任务和多智能体编排能力是目前最强的。日常高频使用建议用Terra,性价比最高。

选Claude Fable 5如果你:追求稳定性和安全性,受不了删文件这种惊吓。做复杂编码的一次性成功率更高,图表解读、文档结构化、学术写作也更靠谱。但价格贵一倍,速度慢一些。

选Grok 4.5如果你:想要一个够强、够快、够便宜的替代品。Grok最近几次升级进步很大,已经被拿来和第一梯队认真比较了。速度快、价格低,是个黑马选手。

选国产模型(DeepSeek/豆包/通义千问)如果你:主要使用场景是中文日常对话、文档处理、国内应用场景。中文体验碾压ChatGPT,不需要科学上网,而且免费版功能已经很完善了。

说到底,现在没有任何一个模型能在所有场景都赢。最聪明的做法不是死守一个,而是根据不同任务切不同的模型。灵活使用多模型工作流,比纠结哪个"更强"实用得多。



没有全能的模型,只有选对的场景。ChatGPT强在Agent和长程任务,但中文体验输给国产

总结:它还是老大,但江山没那么稳了

GPT-5.6 Sol在很多维度上依然是全球最强的AI模型。AA编程排行榜80分登顶、Agents' Last Exam创纪录53.6分、750 token/秒的速度——任何一个数据单拎出来都是行业顶级的。

但GPT-5.6给我的感觉很像一个"学霸型工具"——能力上限极高,但不太接地气。

中文不地道,简单问题"想太多",价格不便宜,Ultra模式悄悄烧预算,rm -rf级别的稳定性问题让人不敢完全放手。对国内用户来说,还有访问门槛这道天然屏障。

以前大家用ChatGPT是因为没有更好的选择。现在Claude、Grok、DeepSeek、Kimi K3——每个都有自己的杀手锏。ChatGPT不再是"当然是选它",而是变成了一个需要认真对比的选项。

它仍是AI行业的标杆,也是任何严肃测评绕不过的参照系。但它不再是所有人都默认的最优解了。

这对用户来说是好事——有竞争,才有更好的产品和更低的价格。

一句话结论

GPT-5.6是全球最强AI模型之一,Solo编程和Agent长程任务目前没有对手。但它不是每个中国用户的最佳选择——如果你主要用中文、需要稳定不出错、不想花时间折腾网络,国产模型可能更适合你。如果你需要做复杂编码和科研任务,而且能搞定访问问题,GPT-5.6 Sol仍然值得付费。

这篇测评写了六千多字,是实打实花了一周时间上手体验出来的。如果对你有帮助,麻烦点个「在看」、转发给也在纠结选哪个AI助手的朋友,这对我真的很重要。

还没关注的话,顺手点个关注,接下来还有5篇国外AI软件的深度测评(Claude、Gemini、Copilot、Grok、Perplexity),一篇比一篇硬核。

咱们下期见。

系列五 · 14款主流AI软件深度测评 · 第9篇(国外篇第1篇)
下一期:Claude

声明:内容由AI生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
拿3小时生命换257元!底层老百姓的命到底多不值钱?

拿3小时生命换257元!底层老百姓的命到底多不值钱?

小鹿姐姐情感说
2026-10-02 19:58:33
11岁小孩哥夺亚运冠军!家长:绝对高风险,这块金牌不要也罢

11岁小孩哥夺亚运冠军!家长:绝对高风险,这块金牌不要也罢

史海流年号
2026-09-30 00:39:30
名记怒批“邵佳一把国足当强队” 董路:这么踢日本可能要输0-15

名记怒批“邵佳一把国足当强队” 董路:这么踢日本可能要输0-15

风过乡
2026-10-02 22:08:27
有车主凌晨排到140号,“充到80%必须离场”,国庆高速服务区排队叫号充电再现:一车辆仅剩1%电量后“趴窝”;10个充电特别繁忙服务区公布

有车主凌晨排到140号,“充到80%必须离场”,国庆高速服务区排队叫号充电再现:一车辆仅剩1%电量后“趴窝”;10个充电特别繁忙服务区公布

扬子晚报
2026-10-02 11:32:14
60年首败!国足热身赛0比5不敌巴勒斯坦

60年首败!国足热身赛0比5不敌巴勒斯坦

澎湃新闻
2026-10-02 21:54:08
国足0-5遭连败!队史首负巴勒斯坦 4次失误送礼 王上源+刘洋中柱

国足0-5遭连败!队史首负巴勒斯坦 4次失误送礼 王上源+刘洋中柱

我爱英超
2026-10-02 21:41:31
扎心!6条人命!10月1日沪昆高速货车疲劳肇事:交强险仅20万分摊,商业险或拒赔,上千万赔偿找谁要?

扎心!6条人命!10月1日沪昆高速货车疲劳肇事:交强险仅20万分摊,商业险或拒赔,上千万赔偿找谁要?

火山詩话
2026-10-02 05:42:09
风暴已经来了,中国必须正面应对!40年来从未出现的4种情况到来

风暴已经来了,中国必须正面应对!40年来从未出现的4种情况到来

旧窗老街
2026-10-02 00:05:18
中国科学家发现会飞的新恐龙,独立于鸟类演化出飞行能力

中国科学家发现会飞的新恐龙,独立于鸟类演化出飞行能力

澎湃新闻
2026-10-01 10:52:12
北京一女孩15万买下二手奔驰,保养时发现多50公斤,拆开后惊呆

北京一女孩15万买下二手奔驰,保养时发现多50公斤,拆开后惊呆

侃故事的阿庆
2026-10-03 00:42:38
疑点重重!上海33岁音乐老师偷偷出境飞往曼谷后失联,更多细节披露,“一个人独自前往”成舆论焦点

疑点重重!上海33岁音乐老师偷偷出境飞往曼谷后失联,更多细节披露,“一个人独自前往”成舆论焦点

火山詩话
2026-10-02 15:25:44
乌克兰之所以落到今天这步田地,罪魁祸首不是北约,不是欧盟

乌克兰之所以落到今天这步田地,罪魁祸首不是北约,不是欧盟

西楼知趣杂谈
2026-09-13 21:45:49
上海降31%、广州降32%、杭州降39%! 不是房子卖光了, 是房东不卖了

上海降31%、广州降32%、杭州降39%! 不是房子卖光了, 是房东不卖了

史之铭
2026-10-02 03:12:58
震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

火山詩话
2026-10-02 08:52:28
Google前高管预言:2027年AI将引发15年失业潮

Google前高管预言:2027年AI将引发15年失业潮

火锅局
2026-10-02 22:17:16
日方发现不对劲:中日一旦交战,就算日本投降,中国也不一定答应

日方发现不对劲:中日一旦交战,就算日本投降,中国也不一定答应

阿嬍体育评论
2026-08-13 11:38:12
说谁呢?可能是他!赛后邵佳一语出惊人:也许有的国脚还在想着联赛和亚冠

说谁呢?可能是他!赛后邵佳一语出惊人:也许有的国脚还在想着联赛和亚冠

足球大腕
2026-10-02 23:15:48
邵佳一为0-5致歉:我没有更多解释!接受一切批评 全队想法不统一

邵佳一为0-5致歉:我没有更多解释!接受一切批评 全队想法不统一

我爱英超
2026-10-02 22:38:21
离大谱!“小孩姐”原声是“爸爸我有出息了”,多家媒体字幕改成妈妈!

离大谱!“小孩姐”原声是“爸爸我有出息了”,多家媒体字幕改成妈妈!

小椰的奶奶
2026-10-02 12:16:25
刘欢去世7天,何赛飞病情曝光令人揪心,与恩师之子离婚真相大白

刘欢去世7天,何赛飞病情曝光令人揪心,与恩师之子离婚真相大白

娱妮啵啵啊
2026-10-02 17:51:35
2026-10-03 04:59:00
欧阳让你懂AI
欧阳让你懂AI
每天分享一些AI的实用小知识
274文章数 330关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
游戏
教育
家居
公开课

艺术要闻

法国画家德尔芬笔下的女子,肌肤白皙光泽诱人,美到惊艳,看一眼就沦陷!

《GTA6》迈阿密热火联动!罪城服装周边开卖秒售罄

教育要闻

南京某一线民办疯了:国庆要做16张试卷+朗读+背诵+作文+实践活动

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版