网易首页 > 网易号 > 正文 申请入驻

智谱认领“牛来”模型,实测:“牛马”友好

0
分享至


作者|冬梅

过去一个周末,全球 AI 开发者都在追问同一个问题:突然出现在 OpenRouter 上的神秘模型 Ox Alpha,究竟来自哪家实验室?

它没有公布开发者,没有披露参数规模,也没有给出技术报告,只以“匿名模型”的身份开放使用。

但在短短几天内,Ox Alpha 迅速冲上 OpenRouter 热门榜单,并凭借代码生成、复杂推理和长时间 Agent 任务中的表现,引发了大量猜测。

“牛来”模型谜底揭晓,是 GLM-5.3-Flash

现在,谜底终于揭晓。

昨天晚上,智谱正式确认:Ox Alpha 正是其最新发布的 GLM-5.3-Flash。过去一周在海外开发者社区引起轰动的“神秘模型”,真的来自智谱。


Ox Alpha 最早于 8 月 20 日匿名登陆 OpenRouter。

在身份揭晓前,OpenRouter 对它的描述是:一款面向代码、持续智能体工作和生产负载设计的推理模型,适合处理长期软件工程、复杂推理,以及结合文本和视觉信息的工作流。

它可以接收文本、图片和视频输入,输出文本,匿名测试版本提供 104 万 Token 上下文。

OpenCode 还曾宣布向用户免费开放一周,并称模型提供方准备了每天 100 万亿 Token 的服务能力。

这种近乎“无限量免费”的测试方式,让 Ox Alpha 在几天内获得了大量真实用户。

Stripe 联合创始人兼 CEO Patrick Collison 体验后表示,它“非常令人印象深刻”。


一部分开发者则发现,Ox Alpha 在代码修改、前端生成、理解大型代码仓库以及连续调用工具方面,表现并不像一款普通的低成本模型。

外界对其身份的猜测也由此升温。

事实证明,Ox Alpha 并非智谱在 GLM 之外另起炉灶,而是 GLM-5 系列中的新成员——GLM-5.3-Flash。匿名上线更接近一次大规模公开盲测:先隐藏厂商和模型名称,让开发者根据实际使用效果作出判断,再公布身份和技术细节。

智谱此前也采用过类似方式测试 Pony Alpha。相比直接发布基准测试成绩,匿名测试能够在一定程度上减少品牌认知对评价的影响,也能在正式发布前获得更大规模的真实负载和用户反馈。

根据智谱官方博客,Ox Alpha 在 OpenCode 和 OpenRouter 开放期间,一度成为当周最受欢迎的模型。



更加值得注意的是,匿名测试期间产生的全部流量,均由部署在国产 AI 芯片上的大规模集群承载。

新模型怎么样?

GLM-5.3-Flash 是一款混合专家模型,拥有 3200 亿总参数,但每次处理 Token 时只激活约 180 亿参数。

这意味着,它保留了大模型的参数容量,但不需要在每次推理时调用全部 3200 亿参数。

模型会根据输入内容,将任务分配给部分专家网络,在模型能力、推理速度和部署成本之间寻找平衡。

与 GLM-4.5 系列相比,两者的总参数量接近,分别为 3200 亿和 3550 亿,但 GLM-5.3-Flash 的激活参数从 320 亿下降到 180 亿,模型层数也由 92 层减少至 45 层。

激活参数和层数减少,可以直接降低单个 Token 推理时需要完成的计算量。

这也是 GLM-5.3-Flash 名称中“Flash”的一层含义:它并非简单缩小模型,而是希望通过架构变化,用更少的实际计算量保留接近大型模型的能力。

GLM-5.3-Flash 还是 GLM-5 系列中第一款原生多模态模型,可以同时处理文本、图片、视频和文件,并提供约 100 万 Token 上下文窗口。

智谱称,该模型采用了最新的 30 万亿 Token 多模态预训练语料。这意味着其视觉能力并非在纯文本模型训练完成后简单外挂,而是在预训练阶段便将文本与视觉信息纳入统一模型。

模型权重目前已经在 Hugging Face 开放,并采用相对宽松的 MIT 许可证。开发者可以通过 SGLang、vLLM、KTransformers 和 TokenSpeed 等框架进行本地部署。

模型地址:https://huggingface.co/zai-org/GLM-5.3-Flash

具体而言,新模型有哪些亮点值得关注?

亮点一:重新设计的注意力机制

首先是为百万 Token 上下文重新设计的注意力机制。

长上下文一直是大模型推理成本增长最快的部分之一。

模型需要记住的内容越多,注意力计算量和 KV Cache 占用的显存就越大。当上下文扩展到 100 万 Token 后,如果继续沿用传统注意力机制,服务成本和硬件压力都会明显上升。

为了降低这部分开销,GLM-5.3-Flash 采用了线性注意力与稀疏注意力结合的混合架构。智谱将其称为首个采用这种混合架构的开源前沿模型。

其中,线性注意力主要通过状态建模捕捉局部依赖;稀疏注意力则通过轻量级索引器,从更长的上下文中寻找与当前任务相关的信息。

简单来说,模型不必在每一次生成时都让所有 Token 彼此进行完整计算,而是先利用线性注意力处理局部信息,再从百万 Token 上下文中检索真正相关的全局内容。

为进一步降低百万 Token 场景下索引器的延迟和内存占用,智谱还设计了 IndexPool,通过加权池化将四个索引器 Key 向量压缩为一个。

按照智谱给出的测算,与 GLM-5.3 相比,GLM-5.3-Flash 的注意力计算量降至约三分之一,KV Cache 规模降至约四分之一,分别减少 3.01 倍和 4.44 倍。

不过,智谱也没有回避它与其他模型之间的差距。

在其对 GLM-5.3、DeepSeek-V4-Flash 和 Kimi-K3 的对比中,GLM-5.3-Flash 的注意力计算量最低,但 KV Cache 仍然略大于 Kimi-K3 和 DeepSeek-V4-Flash,说明其显存效率仍有进一步优化空间。

除了混合注意力,GLM-5.3-Flash 还引入了 Manifold-Constrained Hyper-Connections,也就是 mHC,用于提高模型扩展过程中的训练稳定性和参数利用效率。

这些改动共同指向一个目标:GLM-5.3-Flash 不追求单纯把模型做得更大,而是希望减少完成同一任务所需的实际计算和存储资源。

亮点二:代码和 Agent 能力,是“牛来”的主要长板

从智谱公布的测试结果看,GLM-5.3-Flash 的优势主要集中在代码、工具调用和长时间 Agent 任务上。

在 DeepSWE v1.1 中,GLM-5.3-Flash 取得 63.4 分,高于 GLM-5.2 的 46.2 分。DeepSWE 关注的并不是让模型补全一段代码,而是测试它能否进入真实代码仓库,理解项目结构、定位问题并完成修改。

在用于测试自动化操作能力的 AutomationBench 中,GLM-5.3-Flash 取得 48.8 分,GLM-5.2 为 26.2 分。此外,它在 NL2Repo 上取得 56.3 分,在 Toolathlon Verified 上取得 78.4 分,在 Agents’ Last Exam 中取得 26.3 分,在 Terminal-Bench 2.1 中取得 84.3 分。


Terminal-Bench 主要测试模型能否在真实终端环境中完成软件工程、系统管理和数据处理任务。模型不仅要给出答案,还要实际调用命令、观察执行结果、处理错误并继续推进任务。

这些测试更接近当前 Coding Agent 的工作方式:模型需要连续思考和操作,而不是一次性生成代码。

在智谱内部的 Z.ai Code Bench v1.0 测试中,GLM-5.3-Flash 在不同推理强度下均超过 GLM-5.2。在最高推理强度下,它取得 29.0 分,接近 Claude Opus 4.8 的 29.5 分。该测试运行在 Claude Code 2.1.207 环境中。


第三方机构 Artificial Analysis 则给 GLM-5.3-Flash 的综合智能指数打出 57 分。

在优惠价格口径下,其平均每项任务成本约为 0.045 美元。智谱称,过去大约需要十倍成本才能获得相近水平的综合表现。


不同代码和 Agent 模型采用的测试框架、工具环境、推理预算、最大输出长度和超时时间可能存在差异。例如,智谱在 Terminal-Bench 2.1 测试中允许模型最长运行 6 小时,并将最大生成长度设为 65536 Token;DeepSWE 同样采用 6 小时超时设置。

因此,基准测试能够说明模型在特定设置下具备较强的代码和 Agent 能力,却不能直接等同于所有真实生产任务中的表现。智谱内部的 Z.ai Code Bench 同样属于厂商自测,仍需要更多第三方复现。

Ox Alpha 匿名测试的意义,恰恰在于补充了跑分之外的证据:在开发者不知道厂商和模型名称的情况下,它仍然依靠真实体验获得了较高关注度。

亮点三:视觉能力进入代码执行闭环

GLM-5.3-Flash 的另一项变化,是不再把视觉理解视为独立的看图能力,而是将其放入代码和 Agent 执行过程中。

传统代码模型生成网页、游戏或 3D 场景后,主要通过程序是否成功运行、测试是否通过来判断任务是否完成。但很多问题无法仅通过代码检查发现。

一个网页可能可以正常启动,按钮和颜色却与设计稿明显不符;一段 Blender 脚本可能成功运行,最终场景却存在模型穿插、比例错误或光照异常;一款游戏可能没有报错,却无法真正完成交互。


初始版本存在布局问题


视觉自我验证后

GLM-5.3-Flash 试图形成“观察—实现—使用—修正”的闭环:模型先读取截图、设计稿、页面录屏或者真实软件界面,生成代码并运行,再观察渲染结果,与参考画面进行比较,最后继续修改。

为此,智谱构建了面向视觉编码的数据合成流程,重点训练模型的自我视觉判断和测试时改进能力。在前端开发场景中,团队还引入环境反馈强化学习,并通过基于真实用户流程的 Agent 验证,提高模型对 GUI 界面和交互结果的判断能力。

这种能力可以覆盖前端页面复刻、游戏开发、Blender 3D 场景、CAD 建模以及 Computer Use 等任务。

国产芯片撑起了 Ox Alpha 的全部流量

GLM-5.3-Flash 官方博客中另一个值得关注的信息,是 Ox Alpha 匿名测试期间的全部推理流量均运行在国产 AI 芯片集群上。

智谱称,为解决单颗国产芯片在计算能力和显存容量上的限制,团队基于 SGLang 为 GLM-5.3-Flash 开发了专用推理引擎。

其中包括多项针对模型架构和硬件特点的优化:线性注意力和 LM Head 采用节点内张量并行,引入 ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合 KV Cache 量化,以及 Layer Split 等方案。

在集群层面,智谱采用 Encode—Prefill—Decode 分离架构,将多模态编码、提示词预填充和逐 Token 解码拆分为可以独立调度和扩展的工作池。

这三个阶段的计算特征并不相同。图像和视频编码更依赖多模态计算,Prefill 需要一次性处理大量输入 Token,Decode 则需要持续生成 Token。将三者拆开后,系统可以分别分配硬件资源,避免不同负载互相等待。

按照智谱披露,这套系统已经运行在数万颗国产加速芯片之上。相较最初在同一硬件上的基线版本,端到端推理性能提高了 3 倍,每 Token 成本和硬件效率达到与主流英伟达 GPU 相当的水平。

实测:“牛马”友好

全网都在实测这款模型,小编也忍不住上手测了下。GLM-5.3-Flash 主打原生多模态、Coding、长上下文和 Agent 任务,所以我把这次测试的重点放在了“看懂—规划—执行—检查”的闭环能力上。

首先给模型出了一道测试题:有三个盒子,标签分别写着“苹果”“橘子”“苹果和橘子”,但三个标签全部贴错了。你只能从一个盒子里取出一个水果,如何确定三个盒子分别装了什么?先给答案,再用不超过 150 字解释。

GLM-5.3-Flash 耗时仅 13 秒,消耗 2303 token 就给出了答案,它答道:从标“苹果和橘子”的盒子取一个。

解释:因为三个标签全错,“苹果和橘子”标签下一定不是混合,只能是苹果或橘子。若取出苹果,则该盒是苹果;“橘子”标签不能装橘子,只能装混合;“苹果和橘子”标签装橘子。若取出橘子,则对称推出。


结果是正确的,符合推理逻辑。

第二道逻辑测试题的提示词是:我下周要去上海出差三天,需要参加两场会议、采访三家公司,并完成一篇 2500 字报道。请给出一个具体日程。要求每天工作不超过 9 小时;采访之间至少留出 40 分钟;第一天晚上不能写稿;第三天下午 5 点前交稿。请检查计划是否存在时间冲突。

模型给我制定的“上海出差三日日程方案”如下:

前提假设:第一天上午从出发地赴沪(高铁 / 航班约 2.5 小时);纯交通时间不计入工作时长;会议均为半天内的单个会议。

Day 1(周一日)—— 抵达 + 会议 1 + 采访


当日工作时长:约 4.2 小时

但其实这里在时间规划上就出现了一些误差,因为还要算上从家或者公司出发通勤去机场或高铁站的时间。此外整个流程没有预留一些休整时间,这就有点......

Day 2(周二)—— 会议 2 + 采访② + 初稿


当日工作时长:约 7.8 小时

Day 3(周三)—— 采访③ + 完稿提交


当日工作时长:约 6 小时

冲突检查结果


唯一风险点:Day 1 若航班 / 高铁晚点,会影响 13:30 的会议①。建议提前一晚(周日)抵沪入住,或选择 8 点前出发的早班交通。

整体来看,给出的日程规划比较合理,但在任务与任务的衔接上,还是要留出一些休整时间,排得过于紧凑难免让人感到疲惫。

此外,为了测试该模型的图片理解能力,正好昨晚 MiniMax 发布了半年度财报,小编直接截图给它,看看它的理解能力如何。

我的提示词是:请逐项提取图片中的模型名称、分数和排名,整理成表格。先忠实识别原始数据,再总结三个结论。看不清的数字标记为“无法确认”,不允许推测。


新模型基于图中实际数据,给出了三点结论:

  • 收入高速增长:2026 年上半年收入 1.17 亿美元,同比增长 283.1%,业务规模快速扩张。

  • 毛利率改善:毛利增速(+464.8%)远超收入增速;据此计算毛利率从约 12.1% 提升至约 17.9%(此为根据图中数字换算,非公告原文)。

  • 亏损结构分化:《国际财务报告准则》下期内亏损小幅收窄 11.0%,但经调整净亏损扩大 111.2%(约 2.93 亿美元),说明剔除相关项目后经营消耗反而在加大,盈利拐点尚未到来。


从结果来看,GLM-5.3-Flash 能够较准确地识别图片中的模型名称、排名和对应分数,并按照要求整理为结构化内容。图中数字均被完整提取,没有出现明显漏项、错位或将不同列数据混淆的情况。

新模型发布后,海外社区很快围绕其技术路线、免费策略和实际部署展开讨论。

网友 Aniket 略带遗憾地表示:“免费的 Ox Alpha 没有了。”这也从侧面反映出,此前以匿名形式开放测试的 Ox Alpha,可能已经积累了一批用户。


模型运行在哪类硬件上同样受到关注。Rimas 直接询问,它究竟运行在哪款中国芯片上。另有用户希望将 Z.ai Coding Plan 与每月 100 美元的 OpenAI Codex 套餐进行比较,关注两者在编程能力、额度和成本上的实际差异。

此外,也有一些海外用户实测了该模型,一名 x 用户质疑模型处理长时间编程任务的可靠性,于是他连续消耗两个 5 小时额度周期测试该模型,但发现模型仍未能解决一个简单 Bug,最终交付的有效结果也非常有限。


整体来看,海外用户的关注点已经不只停留在模型分数,而是进一步延伸至技术机制、底层芯片、价格和真实编程体验。


https://z.ai/blog/glm-5.3-flash

https://techcrunch.com/2026/08/26/surprise-z-ai-is-the-ai-lab-behind-the-mysterious-ox-alpha-model/

https://x.com/Zai_org/status/2092616204787626030

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

今日荐文

你也「在看」吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
敬一丹因脑出血离世,医生提醒:这5个信号出现一个就要警惕

敬一丹因脑出血离世,医生提醒:这5个信号出现一个就要警惕

人民日报健康客户端
2026-09-13 13:58:24
查尔斯只剩几个月寿命?葬礼提速安排,20亿遗产全给哈里惹怒威廉

查尔斯只剩几个月寿命?葬礼提速安排,20亿遗产全给哈里惹怒威廉

林子说事
2026-09-13 16:51:42
亚运男篮战报:陈盈骏仅8分省队却大胜出线,8强决出5席中日韩

亚运男篮战报:陈盈骏仅8分省队却大胜出线,8强决出5席中日韩

求球不落谛
2026-09-13 13:48:54
周末两个超级事件

周末两个超级事件

贩财局
2026-09-13 14:09:29
女篮世界杯美国法国争冠战!中国队却赢麻了:他们只输给世界第1第2

女篮世界杯美国法国争冠战!中国队却赢麻了:他们只输给世界第1第2

篮球快餐车
2026-09-13 10:56:05
港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

互联网.乱侃秀
2026-09-12 10:37:07
医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

任医生聊健康
2026-09-08 08:10:34
外国选手现场失禁后拒绝道歉!强硬回应赢就是赢 赛前喝豆汁?

外国选手现场失禁后拒绝道歉!强硬回应赢就是赢 赛前喝豆汁?

念洲
2026-09-13 15:37:17
上海交大:在血常规检查中,这6项数值异常,可能是“肿瘤”信号

上海交大:在血常规检查中,这6项数值异常,可能是“肿瘤”信号

叙说医疗健康
2026-09-11 08:00:51
苹果新品全面降价:9月13日,iPhone 18 Pro Max跌破首发价

苹果新品全面降价:9月13日,iPhone 18 Pro Max跌破首发价

搞机小帝
2026-09-13 15:15:49
山东菏泽“一烧烤店主被频繁检查致停业”,系同一名举报人集中投诉116次,已开展核查处理

山东菏泽“一烧烤店主被频繁检查致停业”,系同一名举报人集中投诉116次,已开展核查处理

三湘都市报
2026-09-13 17:31:59
以色列深夜下死手,千吨炸药同时起爆,伊朗二十年投入化为灰烬

以色列深夜下死手,千吨炸药同时起爆,伊朗二十年投入化为灰烬

共工之锚
2026-09-13 20:01:39
“小七龄童”因病医治无效去世 享年84岁

“小七龄童”因病医治无效去世 享年84岁

环球网资讯
2026-09-13 10:53:05
你们是怎么约到妹子的?

你们是怎么约到妹子的?

那年秋天
2026-09-13 18:06:34
临平公安:浙江一公司涉嫌非法吸收公众存款,主要犯罪嫌疑人吴某某等人已被采取刑事强制措施,请集资参与人及时到公安机关报案登记

临平公安:浙江一公司涉嫌非法吸收公众存款,主要犯罪嫌疑人吴某某等人已被采取刑事强制措施,请集资参与人及时到公安机关报案登记

都市快报橙柿互动
2026-09-13 17:18:11
王卫,被查

王卫,被查

第一财经资讯
2026-09-13 16:11:13
“微山湖上静悄悄”改为“紫禁城里静悄悄”,郭德纲有多大的罪?

“微山湖上静悄悄”改为“紫禁城里静悄悄”,郭德纲有多大的罪?

大国老记老顾
2026-09-13 10:37:30
北京新规:无人机“全域禁存” !首都禁飞区9月20日启用;新修订的《北京市无人驾驶航空器管理规定》将自11月15日实施,开放三种处置渠道

北京新规:无人机“全域禁存” !首都禁飞区9月20日启用;新修订的《北京市无人驾驶航空器管理规定》将自11月15日实施,开放三种处置渠道

通航圈
2026-09-13 11:14:37
央视新闻联播播报巡视组反馈,武大被批了一分多钟

央视新闻联播播报巡视组反馈,武大被批了一分多钟

A活着
2026-09-13 11:32:06
李途纯离世,网友:一个公安副局长,是怎么把30亿的太子奶办没的

李途纯离世,网友:一个公安副局长,是怎么把30亿的太子奶办没的

再战五百回合
2026-09-13 11:49:01
2026-09-13 21:44:49
AI前线 incentive-icons
AI前线
面向AI爱好者、开发者和科学家,提供AI领域技术资讯。
1729文章数 171关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

女子投千万开酒店屡屡被罚:想合法10年要交2000多万

头条要闻

女子投千万开酒店屡屡被罚:想合法10年要交2000多万

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

艺术
亲子
时尚
公开课
军事航空

艺术要闻

10个方案选一!北京交通大学雄安南校门亮相,高18.96米!

亲子要闻

一转眼又弄成这样了

伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗总统强硬发声:伊朗不会向美国投降

无障碍浏览 进入关怀版