网易首页 > 网易号 > 正文 申请入驻

混元Hy4 preview上线即排队,能消解腾讯的AI焦虑吗?

0
分享至


混元追上来一截,腾讯的船还在“漏水”。

文 | 郑久宇 编 | 杨肖若


混元这次最新的发布,是没有开发布会的。

8月28日深夜,只有一篇文章加一个开源仓库,Hy4 preview就这么上线了。7700亿总参数、490亿激活和100万Token上下文,Apache 2.0全开放。

这场真正的发布会,或许是发生在三天后的8月31日上演的场景:混元Hy4 preview自8月28日在WorkBuddy首发接入后,任务队列就开始出现频繁排队的情况。

官方赶紧发公告道歉、紧急扩容,就连腾讯公关总监张军也说调用量“出奇猛增”,技术团队整个周末都在推进扩容,并将持续动态调配资源。还说,“受限于高端算力总量和高峰期并发集中,仍不排除个别时段排队。”


那更像是,一个模型用排队的方式,替自己的公司把“焦虑”说了出来。

这就有意思了。因为就在发布前三天,8月25日,腾讯高级执行副总裁汤道生刚在内刊《知点》里写过一篇长文,标题叫《和AI一起长跑:这两年的一些思考》,正面回应“腾讯做AI慢了”。

他有一句话说得挺实在,“要说一点不焦虑,那不可能。”

焦虑或许传导到了资本市场。8月28日,Hy4 preview上线当日,交易日收盘腾讯股价455.2港元,总市值为41437.52亿港元。截至发稿,8月31日收盘股价回落至452.4港元,市值约为4.12万亿港元。

看起来,技术圈一片叫好,但并未催生出二级市场的股价市值行情,市场仍在权衡AI持续高额投入带来的成本压力。

01 船是怎么“漏”的?

腾讯做AI的焦虑,不是今天才有的。

在今年5月13日的腾讯股东大会上,有人问马化腾,腾讯的AI是不是落后了?

马化腾打了个比方,“原来一年前我们以为上了船,后来发现那个船漏水了,又开始换一艘船。现在感觉站上去了,还坐不下去,还是希望船速能快一点。”

“上船”说的是2024年大模型起跑,“漏水”说的是混元,一个被内部外部都承认“落后”的模型。《财经》此前采访的某位AI研究人员说得更直白,混元此前长期“躺平”,自姚顺雨加入后,“走向正轨不少”。

姚顺雨,1998年生,清华姚班、普林斯顿博士,ReAct 和思维树(Tree of Thoughts)的共同提出者,2024年进入OpenAI参与Deep Research 和 Operator。2025年下半年回国,12月就空降腾讯首席AI科学家,向刘炽平汇报。

他接过手的更像是一个“烂摊子”,但也是个明白的摊子。2026年1月底,混元启动底层基础设施全面重建,覆盖预训练、强化学习、数据和评估。3月,腾讯撤销成立近十年的AI Lab;7月23日,大语言模型部与多模态模型部合并为基础模型部,28岁的姚顺雨统管腾讯全部底层模型研发。

根据最新财报,二季度腾讯研发支出了272.8亿元,同比涨了35%;资本开支527.8亿元,同比涨了176%,大头都进了AI算力和训练。

按他说的节奏,混元平均每两个月迭代一次大版本:4月,发布Hy3 preview,7月6日,发布Hy3 正式版,发布一周,调用量较Hy2涨了超68倍,到8月28日,Hy4 preview上线。

48小时前,或许整个行业都盯着同一个问题:这次,腾讯真的追上了吗?

02 押家底般的投入和跑分里的一些真话

先看规格。Hy3是295B总参、21B激活、256K上下文;Hy4 preview直接拉到 770B、49B和1M,注意力机制从GQA换成了Gated DSA 加上IndexCache,残差改成4路iHC。

说人话就是,从长上下文里挑重点看,信息多路并行传,模型变大了近两倍半,但每token激活的只有49B,成本可控。

有博主称,在架构层面,这是混元第一次真正摸到国内顶级模型的边。

定位也换了个说法,不再喊通用,而是为生产力而生。在软件工程、办公分析、游戏开发和科学研究四个场景,靠腾讯内部专家共建数据和 WorkBuddy/CodeBuddy 产品协同打磨。

姚顺雨之前反复讲过一个思路,不训练刷榜的做题家,关心模型在真实场景好不好用。

官方还讲了个更玄的故事,递归自我改进。说Hy4 preview是第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化,自主做算子融合和通信优化,端到端吞吐提升了31.8%。科学方面,把3DBlaschke-Lebesgue 问题的体积下界从0.380799推到了0.41104,离Meissner四面体猜想只剩2%的差距。

顺带官方也坦白了,preview版本复杂任务容易长思考、过度自我验证。这句话后面会反复应验。

腾讯官方公布了一组12项评测的对比,对手是GLM 5.3、Kimi K3、DeepSeek V4 Pro、Qwen 3.8 Max,以及闭源阵营的 GPT 5.6 Sol 和 Claude Opus 5。


别被这一锅粥的表骗了,我们分三档来看:

第一档是跟国产开源同侪,的确是站住了。Terminal Bench 2.1 拿85.4(GLM 5.3 约88.2–88.8、Kimi K3 约85.7–88.3,不同转引会有出入);DeepSWE64.3,略低于Kimi的74.0;但SWE-bench Multilingual 82.9,是开源阵营第一;SWE Atlas Refactoring、Toolathlon-Verified 、OneMillionBench(工具)都领先。

第二档是跟闭源旗舰,差距还是比较明显的。GDPval-AA V2 上,混元 1678,Claude Opus 5 是 1831,GLM 5.3 都压它一头(1763);物理推理的 CritPt 上,混元16.9,处于全场垫底区,GPT 5.6 Sol 是 32.3,Claude 是 29.1;SWE-bench Pro 上,Claude 79.2,混元65.7;HLE 纯文本,Claude 54.9、GPT 49.5,混元 43.4。

第三档是跟自己比,的确进步惊人。DeepSWE 从28.0干到64.3,翻倍还多;ProgramBench从3.6到17.5;Terminal Bench从70.8到85.4。一个半月追回这么多,混元自己都说这是最大的代际增益,这回真不是吹。

还有两个数字,得单独拿出来捋一捋。

一个是官方盲测,有163名内部专家、203个工程任务,Hy4 preview 均分 2.99/4,略优于GLM 5.3(2.92)和 Kimi K3(2.94)。

听着很提气是吧?但仔细看胜负比,对 GLM 是胜 46.8%、负 40.4%,对 Kimi 是胜 51.2%、负 40.9%。负率四成,这就是五五开里探出一个头。而且打分的是腾讯自己的工程师,任务是自家工程任务。这个略优于的含金量,或许是要打折扣的。

另一个是第三方榜单,在Arena.ai的Code Arena WebDev 上,Hy4 preview排第5,1633分、开源模型第3,和 Grok-4.6、GPT-5.6 Sol 咬在同一区间。这是混元模型头一回出现在这种位置。

注意措辞是出现在这个位置,不是站上第一位。混元从落后到第一梯队的叙事,目前一半还靠官方自己的数据撑着,独立机构的大规模横评还没出来。

03 干活的时候,它到底行不行? 跑分归跑分,最终还是要看看实测。很多媒体的实测结果放一起,画面出奇一致:长板是真的长,短板也真的短。 我们也来亲自测试一番,既然接入了WorkBuddy,首先是在办公场景下先跑一跑吧! 我们用前几天让豆包工作的案例测试对比一下,同样抛给WorkBuddy: 帮我分析一下美国大模型公司Anthropic 2026年Q2财报,整理一下核心财务数据(营收、净利润、毛利率、经营性现金流等),做同比对比、生成图表,再帮我对比国内大模型公司的行业情况,最后写一份解读报告。



前后一共等了12分钟左右的时间,它帮我输出了一版报告。 但中间等待的时间确实有点久……不重要,消耗TOKEN后来看看效果对比:




(以上豆包工作给的图表)




(以上是WorkBuddy给的图表)

图表是各有各的风格,你想要什么样的数据和风格,总有一款适合你。 我认为,如果你想要更具体精准一点的,就要把最初的问题提的精细点。 我们再来试试它的一句话生成场景,比如我让它帮我生成马斯克驾着火箭登陆月球的视频。


当然,这个时间也是非常久的。我已经在等模型响应这一环节,等了超过10分钟,等我离开工位去茶水间接个咖啡做个拉伸回来,它告诉我当前模型服务器暂不可用。好家伙,运行转悠半天给我来这个。多少有点崩溃啊!



而且,它的视频生成用的是它自带的生成专家,相当于某个Skill智能体来做这个任务。

我看到,APPSO的测试结论是腾讯终于踩下油门,一句话生成可操作的实时3D月球车场景。南方都市报的测评更狠,让它做3D弹球游戏,它自己跑无头物理验证,发现球会逃逸出球台、发球冲不上去、挡板打不飞三个bug,自己定位、自己修好,全程没用人管。好吧,是我的服务器不行。

我们来试试游戏代码生成如何,一个老生常谈的项目:帮我写一个QQ农场的游戏。


这个倒是挺快的,在后台开始给我干活写代码。5分钟就给我干出一个不错的网页版。


这只是故事的一半。

测试体验后我的一个感受是:复杂任务理解确实更细致了,但是用更长的思考换来的,相同的任务下token消耗比一些模型更大;长任务偶发无限死循环,思考过程过长直接截断、任务终止。

官方承认的过度自我验证,是实打实地体现在账单和等待时间里的。

更尴尬的是,Hy4 preview是纯语言模型,没有视觉、没有多模态。你在WorkBuddy里让它生图生视频,系统会自动切到别的模型,正常扣积分,不占免费额度。官方公告写得很清楚。对着一家说自己要探索全模态智能上限的公司,这代模型先把自己摘出去了

安全披露也是空白。有第三方评测AI Tools Review指出,腾讯没有像Anthropic、OpenAI、Google那样发布 system card、风险框架或安全专项评估。一个自称能自我改进、能自主优化推理基础设施的模型,这个缺口,并不是一件小事。

04 便宜的旗舰和真实的算力

定价倒是干净利落(元/百万 tokens,各家官方定价页我们看看):

大模型

命中缓存

输入

输出

Hy4 preview

0.3

6

18

DeepSeek V4 Pro(高峰时段)

0.3

9

27

GLM 5.3

2.0

8

28

Kimi K3

2.0

20

100

在国产旗舰统一价里,Hy4是全场最低的一档,比 Kimi K3 的输入价便宜了七成。缓存命中0.3元是隐藏亮点,长上下文流水线反复读同一份材料时,第二次起几乎白送。

但这里有个对照组不能漏,那就是DeepSeek V4 Pro 自8月17日起搞峰谷定价,空闲时段 4.5/13.5/0.15,三项都比 Hy4 便宜。

算总账,便宜这件事,腾讯还不是稳赢的那个。

但免费政策还算大方。WorkBuddy/CodeBuddy 里 Hy4 preview 限免到 9 月 10 日,Hy3 顺延到 9 月 30 日,每个人每天有免费额度。想自己验证的,现在零成本。

自托管也不拦着,Apache 2.0,FP8版大约要720GB显存,8卡H200能跑,8卡H100不够。这行小字值得记住,开源免费,但跑得起它的人不多。

所以,焦虑缓解了吗?回到开头那个问题。 对“混元是不是废物”这个舆论问题,答案基本翻案了。从2025年躺平的定性,到2026年8月Arena 代码榜第5、开源第3,混元用6个月证明了重建路线的成立。

这不是赢了几分的事,是这家公司还能不能做出一线模型的事,这个更根本的问题,Hy4 preview确实给出了正面回答。

对姚顺雨个人,这步棋也没走错。入职9个月,两代大版本,代际提升幅度实打实,7 月整合完基础模型部,组织理顺了,产品也跟他绑在一起(WorkBuddy 桌面办公 Agent 市场份额领跑)。至少到目前看来,腾讯请他来是对的。

但对腾讯这家公司,焦虑只减了一半,而且减的是容易的那一半。

难的那一半,Hy4 preview 用自己的三天表现亲自演了一遍:

算力问题。上线即排队,三天紧急扩容,官方明说受限于高端算力总量。二季度527.8 亿的资本开支说明腾讯知道问题在哪,但钱变算力要时间,而排队正在发生。

差距问题。CritPt 垫底区,HLE 落后 Claude Opus 5 十分以上,SWE-bench Pro 落后13.5 分。“开源第一梯队”和“全球第一梯队”之间隔着的,或许恰是腾讯最焦虑的那段距离。

更扎心的是,Claude和GPT没有站着等它。

验证问题。盲测是自家员工打的,跑分是自家 harness 跑的,独立横评还没出炉。第一梯队的叙事,一半还悬在官方数据上。

再看preview本身。过度思考、token 膨胀、死循环和截断,官方全认了。Hy3 preview 到正式版补短板有先例,但在正式版落地前,这些就是用户的真实体验。

以及8月的对手也还在跑。DeepSeek V4-Flash/V4 Pro、Qwen 3.8-Max、GLM-5.3,月底智谱和千问还深夜各发了一款 Flash 试图划斩杀线。Hy4 preview 是在别人加速时追上来的,不是别人停下等它。

马化腾说“希望船速能快一点”。Hy4 preview证明船没沉,还能加速。但漏水的问题,终究要靠算力、时间,以及下一版的正式模型来修。

对腾讯和姚顺雨来说,焦虑的总量大概没变,只是换了一种形态。从我们还行不行,变成了我们还能多快。

这算是一种升级。但升级,并不等于解决。「完」


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
胡塞武装要撑不住了!控制区几乎“腰斩”,红海封锁或成空话

胡塞武装要撑不住了!控制区几乎“腰斩”,红海封锁或成空话

今观天下
2026-09-10 08:21:07
朝鲜国庆78周年!“二号人物”的高光时刻

朝鲜国庆78周年!“二号人物”的高光时刻

IN朝鲜
2026-09-10 13:21:39
不订学生奶就得站着喝水?武汉一家长质疑班主任区别对待,教育局回应

不订学生奶就得站着喝水?武汉一家长质疑班主任区别对待,教育局回应

扬子晚报
2026-09-10 18:59:13
弹道导弹射程大增,喷气无人机也越来越难拦截:基辅或很快成为“战区”

弹道导弹射程大增,喷气无人机也越来越难拦截:基辅或很快成为“战区”

鹰眼Defence
2026-09-09 18:00:08
真正大麻烦来了!熊某回怼别眼红,封号仅开胃菜,大学受举报围攻

真正大麻烦来了!熊某回怼别眼红,封号仅开胃菜,大学受举报围攻

秋之洁
2026-09-10 05:05:07
战争只能开始,不能停止

战争只能开始,不能停止

求实处
2026-09-09 23:46:29
确认了: 两人已离婚!未签婚前协议, 400多亿元财产待分割

确认了: 两人已离婚!未签婚前协议, 400多亿元财产待分割

广州生活美食圈
2026-09-09 20:31:07
杂草丛生!电梯停运!开业7个月就倒闭!号称“西安最难商业”!

杂草丛生!电梯停运!开业7个月就倒闭!号称“西安最难商业”!

木兮聊房
2026-09-10 18:59:55
贾斯汀·比伯与海莉·比伯床上亲密大片曝光

贾斯汀·比伯与海莉·比伯床上亲密大片曝光

追星雷达站
2026-09-08 05:03:31
官方祝贺郑钦文:赢得全世界的尊重和掌声 詹俊:她很接近莱巴金娜

官方祝贺郑钦文:赢得全世界的尊重和掌声 詹俊:她很接近莱巴金娜

风过乡
2026-09-10 08:34:13
参选消息落地了,特朗普沉默了。 9月5日,亨特·拜登高调宣布:“我要参加2028年大选,致力于成为最遵守法律的总统。”

参选消息落地了,特朗普沉默了。 9月5日,亨特·拜登高调宣布:“我要参加2028年大选,致力于成为最遵守法律的总统。”

扶苏聊历史
2026-09-10 17:49:17
王凯谈近几年接戏不多的原因:不是没戏拍,而是主动选择藏起来

王凯谈近几年接戏不多的原因:不是没戏拍,而是主动选择藏起来

娱说瑜悦
2026-09-10 20:12:25
苹果推出首款折叠屏,三星发文暗讽,网友翻出其“十年网怼苹果史”

苹果推出首款折叠屏,三星发文暗讽,网友翻出其“十年网怼苹果史”

红星新闻
2026-09-10 13:04:43
女学生逼人资助反转!官媒质疑是剧本,当地介入彻查,果然有猫腻

女学生逼人资助反转!官媒质疑是剧本,当地介入彻查,果然有猫腻

番外行
2026-09-10 14:42:37
刚刚!无锡市人民政府批复

刚刚!无锡市人民政府批复

无锡eTV全媒体
2026-09-10 19:26:25
上海晚宴太真实!章子怡穿透视裙,千玺满脸疲惫,IU一张脸赢麻了

上海晚宴太真实!章子怡穿透视裙,千玺满脸疲惫,IU一张脸赢麻了

原梦叁生
2026-09-10 20:54:14
5连胜多线狂飙!厄德高世界波+连场破门,阿森纳1-0那不勒斯

5连胜多线狂飙!厄德高世界波+连场破门,阿森纳1-0那不勒斯

钉钉陌上花开
2026-09-10 04:59:10
“长沙摸臀案”舆论升级!知名作家陈岚称,如果发生在美国,遇到的处理方式是以保护未成年人的角度出发的

“长沙摸臀案”舆论升级!知名作家陈岚称,如果发生在美国,遇到的处理方式是以保护未成年人的角度出发的

火山詩话
2026-09-09 07:30:38
菲律宾最高法院宣判:前第一夫人马科斯无罪

菲律宾最高法院宣判:前第一夫人马科斯无罪

亚太观澜
2026-09-10 21:05:07
2-1击败前世界第1!中国女网16岁新星闪耀:看齐偶像郑钦文逆风翻盘

2-1击败前世界第1!中国女网16岁新星闪耀:看齐偶像郑钦文逆风翻盘

李喜林篮球绝杀
2026-09-10 11:21:28
2026-09-10 21:36:49
商业秀 incentive-icons
商业秀
理解商业,看见价值
269文章数 41关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

排队冲突中老人骨折警方未立案 儿子愤怒:打我妈不行

头条要闻

排队冲突中老人骨折警方未立案 儿子愤怒:打我妈不行

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

起步续航640km/3.8秒破百/路特斯底盘调校 银河TT先享价12.99万起

态度原创

教育
手机
数码
艺术
房产

教育要闻

[视频]中央宣传部 教育部联合发布2026年“最美教师”

手机要闻

鸿蒙7登场:华为视频助手实时答疑、花瓣地图一句话出旅行攻略

数码要闻

黑峡谷推出NS68磁轴键盘:全铝机身,双灯双导光,到手699元

艺术要闻

中国第二高楼的4个竞赛方案,建筑界“神仙打架”!

房产要闻

别不服!海南的亿万富豪,只有不到300个!

无障碍浏览 进入关怀版