网易首页 > 网易号 > 正文 申请入驻

GPT-5.6深夜上线,ChatGPT和Codex正式合并,一个时代结束了。

0
分享至

  今天,GPT-5.6终于在OpenAI的直播中正式上线了。

  除了GPT-5.6之外,ChatGPT也迎来了2022年诞生之后,我觉得最大的升级。

  从OpenAI的直播预告动画就能看出来有趣的端倪了,ChatGPT和Codex,在今天、在此刻合体。

  

  于是,全新的ChatGPT来了。

  

  Codex直接消失,与ChatGPT应用正式合并,以后,也没有Codex这个应用了,只有ChatGPT了。

  但是当你打开新版的ChatGPT界面以后,你又会发现,原版的ChatGPT界面也没有了,满屏的UI,都属于原本的Codex,只剩下那个小小的聊天Tab,证明着曾经的ChatGPT,还存在过。

  

  突然有点感慨。

  至此,由ChatGPT 2022年11月30日开启的Chat时代,也在今天完成了属于大众启蒙的使命,而今天,ChatGPT和Codex的合并,一切也都标志着新时代的来临,此名:

  Agent时代。

  让我们一个一个来聊。

  一. GPT-5.6

  先聊最核心的GPT-5.6。

  这次一共是三个模型,分别是 新旗舰模型Sol,以及适用于日常工作的均衡模型Terra,还有OpenAI所谓的最具成本效益的模型Luna。

  我们主要的核心,还是来聊GPT-5.6 Sol,因为这个也基本代表着OpenAI能对外放出来的目前智能的巅峰。

  这个模型强不强,你就看Anthropic的动作就行了,在GPT-5.6 Sol发布后,他们直接决定,重置额度。。。

  

  可能我这几年,从来没有像现在这样,如此期待一个新模型,期待GPT-5.6的上线。

  原因特别简单,因为我那个AI新闻网站AIHOT,虽然大的我能做的都做了,比如IP地址已经换了,且藏在了边缘代理后面,做了部分DDoS防护,封禁策略和JS挑战啥的也都做了。

  但是每天都在被各种手段攻击,最初的普通攻击,到现在几乎全是DDoS,还有用分布式CC来恶心的,各种乱七八糟的。

  昨天一天就被打了4轮,昨天早上的没防住,导致昨天早上又被干崩了,但是 下午的3轮都防住了 。

  

  在这个阶段,Claude Fable 5已经完全没办法用了,因为这些词几乎都是敏感词,一聊DDoS啥的直接给我切换到Opus 4.8,而且Fable 5虽然智商和规划能力超群,但是在真正的执行上,还是有点问题,经常顾此失彼,然后漏很多的东西,并且跟Claude系列一样,有一定的幻觉。

  然后最大的缺点,就是贵,没蹬一会额度就没了。。。

  

  GPT-5.5是我最近反而用的最多的了。

  但是问题也非常大,规划和做方案的能力非常一般,完全不思考全面,起手就知道干,幻觉率确实极低,代码执行确实很强,改BUG啥的很不错,但是吧,也经常不够全面 ,再加上方案和规划能力是一坨, 短板还是有点太明显了。

  经常给我用的非常的暴躁。

  

  在做安全策略上,更是漏洞百出,它做的方案,被人打成筛子,最后还是得我那仅剩的10%额度的Claude Fable 5来进行规则的重置和兜底。

  这7天高强度的攻防和平均每天16个小时的Coding的经验,让我对Fable 5和GPT-5.5的评价一下的话。

  那就是Fable 5确实是一个总监级别的大神,但是你知道的,管理层嘛,一般执行的细节程度上总归有一点的不精确,工具使用、主动性太强了,经常不管不顾的自己就全部给你搞完了,但是最后在一些细节上,是偏离了你想要的东西的。

  而GPT-5.5呢,就是一个高级工程师,在执行上确实是一把好手,但是用一个网友的话来做一个很形象的描述就是:“GPT-5.5最像那种会议室里突然站起来画白板的人,你还在描述混乱,它已经开始拆方案。”

  现在就卡在这了,Claude Fable 5额度用完了,GPT-5.5只能做中型的项目执行。

  所以在这个背景下,大家应该就懂了,为啥我如此的期待GPT-5.6了。

  因为真的希望他们能把整个Coding的能力,再往前推一步,而且我极度支持OpenAI干死呆逼Anthropic。

  在OpenAI 6月26号发布了前瞻之后,今天凌晨,GPT-5.6终于来了。

  

  我第一时间直接把GPT-5.6 Sol拉到最高档Ultra开干了。

  在我高强度并行开发了5个小时之后,我觉得我对GPT-5.6有了一些自己的体感,如果用一段话描述的话,那就是:

  当今世界最水桶级别的模型,价格低廉,性价比极高,方案和规划能力在一些非巨型任务上媲美Fable 5(巨型任务我也接触不到,已经远超我的能力上限了),Agent能力和Coding执行上幻觉率极低极为精准,配合Codex交互体验和远程Coding更是极佳,浏览器控制更加稳定等等。

  不过前端审美和内容创作依然是老大难问题,这块确实比不上Claude,但除此之外,其他的任何方面我想不出来我自己再用Claude的理由了。

  而且,GPT-5.6 Sol,包含在订阅计划中,未来,订阅用户可用!

  OpenAI赛高!Codex赛高!GPT赛高!

  还是惯例,简单过一下GPT-5.6的官方跑分。

  在覆盖55个领域长期专业工作流的Agents' Last Exam中,GPT‑5.6 Sol以53.6分刷新纪录,比Claude Fable 5(自适应推理)高出 13.1 分。

  即便采用中等推理模式,它仍以约四分之一预估成本领先Fable 5达11.4分。

  

  这个我觉得是里程碑式的,Fable 5确实很强,但是那个经济效应,几乎也代表着我们几乎不可能日常大规模的使用。

  而GPT-5.6以极低的成本,完成了执行效果上的超越。

  而在AA家的智能指数上,GPT-5.6比Fable 5只低了一分,但是 任务完成时间缩短61%,成本预估降低约一半。

  

  而在Coding领域,这个优势更加离谱了。

  在Artificial Analysis 编程智能体指数中,启用最大推理能力的 GPT‑5.6 Sol 以 80 分创下最新技术标杆,比Fable 5高出2.8 分,同时输出 token 减少一半以上,耗时缩短一半以上,成本降低约三分之一。

  

  从这张图其实也能看出来,对于日常来说,改BUG啥的其实推理强度开到高就差不多了。

  

  如果是大型的任务,就开到极高。

  

  究极大型的重构或者要命相关(比如我的AIHOT防护)的任务,或者你的token实在烧不完的时候,偶尔再把推理等级开到Ultra,是Token利用率最高的解法。

  而且你知道,当我看到GPT-5.6 Sol在衡量从接触漏洞代码到任意代码执行进展的ExploitBench, 上,它在可比输出token预算下得分为73.5%。

  这意味着什么呢,意味着,只要极低的成本,就可以达到几乎跟Fable 5相同的网络安全效果!!!

  

  说实话,我看到这个的时候,我的眼睛都在冒光,我激动的都睡不着觉。

  而且在我的实测中,虽然偶尔也会出现网络安全的禁止提示。

  

  但是在我表明是为了做我的边缘代理的防护策略,我希望他帮我优化之后,他顺利的给我进行执行了,没有做任何的阻拦。

  我给的任务,就是这个,我因为是语音输入的,还输入错了,把EO识别成了EU,不过这种都是小问题了:

  

  我直接开了Ultra,而且是快速模式,几乎全部都是浏览器操控,在将近21分钟之后,给了我一个非常详细的审查报告。

  我是200刀的Pro套餐,Token的消耗量大概5小时额度花了20%,周额度大概花了2~3%,我想说,这比Fable 5舒服太多了。

  

  要知道,这可是21分钟的全程Chrome操控且开了快速模式,有1.5倍的消耗,再加上Ultra啊!

  如果是Fable 5的话,你相信我,就这么玩,Fable 5 + Ultracode,都没有快速模式一说,一波能给你周额度干没8~10个点。

  太离谱了。

  而且这个质量,非常的高。

  因为我的边缘代理的规则底子是Fable 5打的,后面GPT-5.5在上面打了一些补丁,也做了N次优化,但是感觉也优化不出来啥,找不出来啥问题了。

  但是GPT-5.6 Sol,直接找出了一堆以前他两没有想到的问题。

  

  我就不放全文了,因为漏洞太多了。。。

  直接扒拉出来了11个任务。

  反正我是叹为观止,然后让GPT-5.6 Sol一波直接自己去修了。

  非常的稳,一波处理的明明白白,没有任何的BUG,就看明天被攻击时候的实际防护效果了。

  然后还有一个方案,大概能看出来GPT-5.6 Sol和Claude Fable 5的一些性格和个性的区别。

  比如我有一个长久以来的痛点,就是为了AIHOT大家无需开魔法的阅读体验,所以我做了每个新闻的详情页,就像这样。

  

  但是这个详情页想法是好的,在实现上,有巨大的问题,因为我要把所有源站的信息,原封不动的抓过来,然后尽可能的给大家还原成跟源站一样的阅读体验。

  但是你要知道,我现在监控信源的背后,有几百个形色各异的网站,我已经尽可能的去想尽一切办法去处理了,还是经常会抓来一些奇奇怪怪的东西。

  就像这样。

  

  还有这样。

  

  想适配所有的网页,全部清洗成好看的,几乎跟源站一样的,甚至还要保留格式、超链接、代码库、图表等等,太难了,因为背后的网页形式实在是太多太多了,之前用Opus 4.8和GPT-5.5分别开发过,效果基本就是一坨狗屎。

  但是我一直还是想解决这个需求,让AIHOT的用户在浏览信息上,能得到最好的体验。

  所以我就把这个需求,同时扔给了GPT-5.6 Sol和Claude Fable 5。

  让他俩同时想方案。

  

  甚至他两用的都是同一份CLAUDE.md,因为我的AGENTS.md直接软链的 CLAUDE.md, 所以几乎变量都是一样的,唯一不同的就是模型本身。

  而最终输出后,GPT-5.6的方案,坦诚的讲,在细致程度上,我甚至觉得比Fable 5考虑的更加周全,这确实是一个很有趣的点。

  比如一开始,从源头上,其实是有分类的,比如有很多不是直接抓取的,是走API和RSS的。

  

  这些是有明确的正文的。

  而在GPT-5.6的考虑中,也想到这部分,但是,他并没有跟Fable 5一样,直接把那个规则当做了必须遵守的。

  而是提出了质疑。

  

  所以,我们不能信他们,所有的源头都只是源头而已,我们必须自己要去做结构化的正文抽离,即使它是RSS和API输出来的,也需要如此考虑。

  Fable 5其实把这个细节漏了。

  包括有一个同域名网站里最近反复出现的内容,大概率就是导航啊固定CTA啥的,所以其实可以做标准化的统计,重复的就可以被识别出来了直接删掉。

  GPT-5.6和Fable 5都考虑到了这一点,但是还是那个问题,在首次的输出上,依然是GPT-5.6考虑的更加细致一点。

  而且还有个更离谱的是,我觉得,这一次GPT-5.6输出内容的可读性,我觉得比Fable 5是要强的,他的方案我能读的下去,但是Fable 5,可能是我太菜逼了,他的信息密度太高了,我读不下去。

  最后这两个方案,我还是选择了让GPT-5.6 Sol去开了目标模式进行最终执行。

  

  因为坦率的讲,这个任务有点复杂,我对Claude Fable 5能长时的稳定的精准的处理完这么多细节,我没有信心,后期其实还是容易出现幻觉,改了这里忘了那里,然后最后再对抗性审查的时候又不断的推翻自己,很麻烦。

  但是GPT-5.6的幻觉率在我的测试过程中,我体感是一如既往的,几乎就是洲际导弹的级别,指哪打哪,再配合上目标模式,最后总是能极其精准的完成任务,真的很香。

  虽然过程中也会偶发跟GPT-5.5一样,有一些奇怪的低级错误导致了部分环节中的循环,但是次数会少一些,同时也能更快的解决,且不影响最终的输出。

  然后之前的那个任务,截止到我发文的时候,已经开发了快2个小时了,但是还没有开发完,主要是逐篇审查对比优化,确实比较浪费时间。

  

  但是在它测试过程,我看到了一些页面,还是很棒的,我现在有点期待完他写完以后,部署到AIHOT上的效果了。

  然后是前端审美这块,确实比GPT-5.5有巨幅加强,但是还是离Claude有一定距离。

  比如最近马上台风不是要来了吗,我随手写了一个Prompt:

  调用一个接口获取巴威台风数据, 生成一个单HTML文件的可视化大屏。

  GPT-5.5的效果是这样的,就Emmmmmm。

  

  但是GPT-5.6 Sol是这样的。

  

  前端效果上还是进化了很多的,至少是不会出AI Slop了。

  目前Plus、Pro用户可以使用GPT‑5.6 Sol,而免费和Go用户,只能使用 GPT‑5.6 Terra。

  而最高档的Ultra推理等级,只对200刀的Pro用户开放,Plus用户也用不了。

  目前GPT‑5.6按每百万Token计费。

  Sol 为 5 美元输入 / 30 美元输出;Terra 为 2.5 美元输入 / 15 美元输出;Luna 为 1 美元输入 / 6 美元输出。

  GPT‑5.6 还引入了更可预测的提示缓存功能,包括支持显式缓存断点⁠以及30分钟的最低缓存生命周期。

  对于GPT‑5.6及后续模型,缓存写入按模型非缓存输入价格的1.25倍计费,而缓存读取则继续享受90%的缓存输入折扣。

  二. ChatGPT Work

  这是一个我没有想到的更新。

  也就是我们开头所说的,合并了ChatGPT和Codex。

  现在,你可以在左上角,直接切换工作和Codex了。

  

  其实就是Cowork和Claude Code的区别。

  Codex虽然是个通用Agent,可能一些专业者都知道,他既能写代码,也能办公,完全没有问题的。

  但是依然有个市场的老大难问题,就是心智问题,你一说你能开发,你能写代码,很多的用户依然会觉得,那上手门槛是不是很高。

  所以从心智上来说,Work和Code,反而拆开应该是最好的,虽然底层都是一个东西,但是用户认账啊。

  你看国内WorkBuddy就知道了,现在都千万日活了,你这找谁说理去。

  而OpenAI的产品确实有点东西,他们妙就妙在这里,没有选择推出Codex Work,而是直接把ChatGPT这个10亿周活的巨无霸给改造了,变成了ChatGPT Work,你看,这是不是就好理解多了。

  而且过去的ChatGPT用户迁移过来,那简直顺理成章。

  不过你要说这个Work模式跟Codex的区别,我觉得可以小到忽略不计了。

  最大的心智特征,可能就是在这个菜单栏上,把分支啥的偏Code的元素,换成了Doc、PPT、Excel三件套,让你体感上,更像是帮你工作的。

  

  我随手用GPT-5.6 Sol给它自己的上线,用它自己的插件,做了个PPT。

  

  就咋说呢,GPT系列的审美啊,是不是得GPT-6的全新一代的预训练模型才能补上了。。

  只是纯能看了。

  不过处理表格啥的数据分析任务,那是真的强,强到上天。

  有条件的,我推荐大家所有人都可以去下一个ChatGPT的应用,用它来帮大家去处理工作,这可能是你当今,能用上的性价比最高、质量最好的Work类Agent产品了。

  而之前的ChatGPT Chat模式,也就是聊天,被藏在了一个小小的tab中,就好像,它的历史使命已经完成了。

  

  点击以后,右下角会出现一个弹窗,这个小小的界面,就是ChatGPT Chat了。

  

  而且这次还有个好玩的新东西,也是给Work场景用的。

  就是新增了一个叫站点的功能。

  

  我们过去都知道,很多非开发者,其实做了一个产品,想要部署到线上,给别人用还是很麻烦的一件事。

  所以OpenAI这次就为了解决这个需求,搞了这么个功能。

  底层本质是包了一个他们自己的叫Sites的Skill。

  

  你做完一个东西以后,直接用Prompt说一句话,比如用Sites部署一下。

  

  他就会自己帮你部署到线上,然后给你一个域名,这个域名就可以分享给你的朋友和同事了。

  

  对大众来说,极其友好。

  我觉得这一次,OpenAI用他们的产品、用他们的模型,再一次证明了。

  这家公司,还是有生命力的,他们还是当年的那个OpenAI。

  曾经的OpenAI,是面对Google的屠龙少年,随着时代的发展,他们逐渐从勇士,变成了金银财宝之上的恶龙。

  他们开始骂声一片,没人再喜欢他们,大家都在说,OpenAI就该完蛋。

  可随着Anthropic的异军突起,OpenAI有那么一段时间,被打的全线开花。

  他灰溜溜的走下了王座,看着曾经它的王座上,盘踞一条新的恶龙。

  随后,他重新拾起盾牌,捡起那个已经开始发绣的剑。

  斩向了自己的身后,把那个亲手将自己送上傲慢王座的Sora,一刀斩断。

  它决定回到群众中,做群众想要的模型,做群众喜欢的产品。

  直到几个月后的今天,他又回到了那个曾经属于他们的王座之前,站在了那个叫Anthropic的恶龙之前。

  他说,这次。

  轮到你了。

  以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

  >/ 作者:卡兹克

  >/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
小米澎程首撞冲上绿化带,雷军流量反噬来了!

小米澎程首撞冲上绿化带,雷军流量反噬来了!

互联网品牌官
2026-09-09 15:41:33
妮可·基德曼回忆2003年奥斯卡封后之夜:没有伴侣分享,感到“孤独到极点”

妮可·基德曼回忆2003年奥斯卡封后之夜:没有伴侣分享,感到“孤独到极点”

追星雷达站
2026-09-11 02:11:59
美媒:多架美国军机在伊朗对约旦基地袭击中受损

美媒:多架美国军机在伊朗对约旦基地袭击中受损

新华社
2026-09-10 10:18:04
WTT澳门赛:9月12日赛程公布!国乒对决张本智和,再战韩莹梅谢芙

WTT澳门赛:9月12日赛程公布!国乒对决张本智和,再战韩莹梅谢芙

郝小小看体育
2026-09-12 00:14:29
为啥在访问中国之后,不少“欧美的高管”回去时都感到压力超大?

为啥在访问中国之后,不少“欧美的高管”回去时都感到压力超大?

趣味萌宠的日常
2026-09-11 11:51:08
马卡:楚阿梅尼接下来回归首发,穆里尼奥中场位置多了新选择

马卡:楚阿梅尼接下来回归首发,穆里尼奥中场位置多了新选择

懂球帝
2026-09-11 22:43:08
千问、智谱开始做地推抢用户了!

千问、智谱开始做地推抢用户了!

人人都是产品经理社区
2026-09-10 21:45:41
湿漉漉的比基尼,把视觉重心留给泳衣和碧海蓝天

湿漉漉的比基尼,把视觉重心留给泳衣和碧海蓝天

分享情感的梅梅
2026-09-03 08:29:56
为什么很少看到有人追求孙颖莎?

为什么很少看到有人追求孙颖莎?

乒乓乐园
2026-09-12 01:01:42
打假网红“铁头”敲诈勒索案一审宣判!此前伙同他人以曝黑料相威胁,向某带货主播索要数百克黄金

打假网红“铁头”敲诈勒索案一审宣判!此前伙同他人以曝黑料相威胁,向某带货主播索要数百克黄金

上观新闻
2026-09-11 16:54:50
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
受权发布|中华人民共和国国务院令  第846号

受权发布|中华人民共和国国务院令  第846号

新华社
2026-09-11 17:03:08
李凯尔再请缨:已和男篮谈过,渴望参加世界杯!但不适配仍存疑!

李凯尔再请缨:已和男篮谈过,渴望参加世界杯!但不适配仍存疑!

篮球资讯达人
2026-09-11 13:44:52
给男人一个忠告:女人再漂亮,睡在一个被窝里也别暴露这3个秘密

给男人一个忠告:女人再漂亮,睡在一个被窝里也别暴露这3个秘密

阿凯销售场
2026-09-11 18:55:13
姜文女儿近况:产后几天拿红带绑婴儿爬山,素颜生图面色红润能打

姜文女儿近况:产后几天拿红带绑婴儿爬山,素颜生图面色红润能打

娱圈办事处
2026-09-11 20:14:02
赵一曼牺牲前有多惨?日军晚年回忆:她的惨叫像来自地狱的声音

赵一曼牺牲前有多惨?日军晚年回忆:她的惨叫像来自地狱的声音

纪史行者
2026-08-10 21:11:31
突发:唐山地震

突发:唐山地震

浙江之声
2026-09-11 14:58:55
CCTV5直播,中国女篮VS泰国女篮,杨舒予2人成胜负手,剑指开门红

CCTV5直播,中国女篮VS泰国女篮,杨舒予2人成胜负手,剑指开门红

体坛小快灵
2026-09-11 12:35:56
莫迪邀菲律宾参加金砖峰会,小马科斯后院起火,政局不稳才是变数

莫迪邀菲律宾参加金砖峰会,小马科斯后院起火,政局不稳才是变数

军情观察家
2026-09-12 03:10:03
晚间公告|9月11日这些公告有看头

晚间公告|9月11日这些公告有看头

第一财经资讯
2026-09-11 18:40:16
2026-09-12 04:19:00
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
590文章数 720关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

健康
游戏
本地
房产
公开课

手脚发麻口齿不清?也可能是中风!

逼老外学中文的魔兽时光服,又要用三件新橙装吊他们胃口了"/> 主站 商城 论坛 自运营 登录 注册 简体中文 简体中文 English 逼老外学...

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版