网易首页 > 网易号 > 正文 申请入驻

御三家格局松动:Google和Meta同日发布新模型,第三名不再稳了?

Google和Meta同日发布新模型

0
分享至



在美国 AI 圈里有个约定俗成的说法叫“御三家”:OpenAI、Anthropic 和 Google。但如今,第三名的 Google 的位置,似乎正在被第四名 Meta 觊觎和追赶。

2026 年 9 月 2 日同一天,Google 推出了 Gemini 3.8 Flash,Meta 则发布了 Muse Spark 1.3。Artificial Analysis 综合榜数据显示,Muse Spark 1.3 的得分略高,不过靠的是未公开的 max 档(62 分);假如只看当天可公开调用的同档位,Muse Spark 1.3 xhigh(61 分)仍然小幅领先 Gemini 3.8 Flash high(59 分)。

要是放在几个月之前,谁能想到,在 Llama 4 之后被不少人认为已经掉队的 Meta,似乎又回到了前沿模型的名单里;一度与 OpenAI、Anthropic 掰手腕的 Gemini,则在新旗舰缺席的窗口期中,暂时失去了与 Fable、Sol 等顶尖模型对比的资格。

而这也可能是很多人非常好奇的问题:短短一年的时间,Google 与 Meta 究竟分别经历了什么,才在同一天交出了这样两张成绩单?

快的是 Flash,慢的是旗舰

我们可以先从谷歌最近的组织调整说起。

过去几个月,Google DeepMind 经历了一轮密集的人事调整。8 月 5 日,长期担任 DeepMind CEO 的 Demis Hassabis 交出日常管理职责,转任 Google DeepMind 董事长和 Alphabet 首席科学家。原 Google DeepMind CTO、Google 首席 AI 架构师 Koray Kavukcuoglu 接管部门,直接向 Google CEO Sundar Pichai 汇报。

在新的管理结构下,Koray 同时负责 Gemini 模型研发、前沿研究、Gemini 应用和开发者团队。Google 给出的解释是,让 Hassabis 将更多精力投入通用人工智能和科学研究,同时把模型与产品团队交给同一位负责人。

同一天,在 Google 工作了 27 年的首席科学家 Jeff Dean 与 Sanjay Ghemawat 等人宣布离开,创办研究机构 Discovery Loop。Google 以创始投资方和云服务合作伙伴的身份参与其中。

更早以前,Transformer 作者之一的 Noam Shazeer 又第二次离开 Google,转投 OpenAI,AlphaFold 核心人物、2024 年诺贝尔化学奖得主 John Jumper 则加入了 Anthropic。

伴随着一连串高层交接和人才流失的,是 Google 旗舰模型交付的反复延期。原本被期待在今年年中推出的 Gemini 3.5 Pro 多次延期。7 月,Google 仍表示这款模型处于合作伙伴测试阶段,将在“准备好后”开放。与此同时,Google 宣布已经启动 Gemini 4 的预训练,但依旧没有公布发布日期。

旗舰模型迟迟没有交付,Flash 系列却保持着另一套更快的节奏。

9 月 2 日发布的Gemini 3.8 Flash,已经是 Google 六周内推出的第三款 Flash,也是不到四个月里的第四款。Google 将它定位为兼顾性能、速度和成本的主力工作模型,重点强化长程软件工程、自主 Agent 和多步骤推理。

频繁更新 Flash,一方面来自真实的产品需求。Google 的模型 API 处于大规模调用阶段,企业客户更关心延迟、成本和可靠性,不会只等一年一度的旗舰发布。另一方面,在 Gemini 3.5 Pro 缺席的几个月里,Flash 需要承担了维持模型声量和开发者节奏的任务。

所以,过去几个月,Google 接连更新 Flash,发布节奏并不慢。只是市场真正等待的 Gemini 3.5 Pro,至今没有出现。

而最新的 Gemini 3.8 Flash 发布时间距离 Koray 接管 Google DeepMind 也不过一个月,这款模型显然无法简单归功于新的管理结构。它更像是 Google 开始调整时留下的一张截面:产品线依然成熟,迭代速度依然很快,最上方的位置却出现了空档。

Meta 先把团队重新跑起来

Meta 的调整开始得更早,也更剧烈。

由于 Llama 4 发布后的市场反响远未达预期,还爆出作弊等等丑闻,扎克伯格对 Meta 的 AI 部门开始了大刀阔斧的调整。2025 年,Meta 投资 143 亿美元取得数据标注公司 Scale AI 49% 的无投票权股份,并招募 Scale AI 创始人 Alexandr Wang 加入公司,重整 AI 业务。

Wang 此后成为 Meta 首席 AI 官,并在 Meta Superintelligence Labs 内组建了约百人的 TBD Lab。这个团队获得了较高的资源优先级和自主权,负责开发 Meta 的核心大模型。

原有的基础人工智能研究实验室 FAIR 仍然存在,更多承担长期和探索性研究。Meta 的模型和产品资源则逐渐向 TBD Lab 集中。

伴随组织重建,Meta 的 AI 战略也开始收窄。此前围绕开源或闭源、通用模型或专用模型的摇摆,逐渐转向“个人超级智能”、Agent 和编程产品。Muse Spark 没有沿用 Llama 的命名,首发版本也是闭源模型。Meta 同时表示,开放权重版本将在之后推出。

Muse Spark 于 2026 年 4 月发布。Meta 7 月推出1.1,8 月推出 1.2,9 月又发布 1.3。五个月内四次更新,模型交付逐渐形成固定节奏。

就在几个月前,Meta 还在大量采购 Google 的模型能力。2026 年 3 月,Google 曾告诉 Meta,由于自身算力供应紧张,无法满足 Meta 希望采购的全部 Gemini 容量。相关限制打乱了 Meta 部分内部 AI 项目。当时,Meta 仍在内容审核、诈骗检测和广告工具等场景使用 Gemini。

虽然我们很难说这是 Google 开始意识到 Meta 的威胁,于是开始给它设置障碍。但它的确呈现出了 Meta 当时的处境:一边投入上百亿美元重建模型团队,一边仍要从 Google 采购模型服务,弥补内部能力的不足。

直到 Muse Spark 的连续发布,开始改变这种局面。

在 Meta 的规划中,Muse Spark 只是模型家族的起点。它没有成为新的行业第一,却让 Meta 摆脱了 Llama 4 之后长时间拿不出有竞争力模型的状态。TBD Lab 能否长期稳定还不清楚,团队至少已经恢复了连续交付。

一边是高层交接后不断更新 Flash,一边是重建团队后把 Muse 推进到第四个版本。到 9 月 2 日,过去一年的组织变化,终于落到了两款可以直接调用的模型上。

于是,Gemini 3.8 Flash 和 Muse Spark 1.3,就成为 Google 和 Meta 在不同阶段交出的两张成绩单。

两家公司交了同一种答卷

从产品定位看,这次同日发布的两款模型其实都定位为“主力工作模型”。

Google 明确把 Gemini 3.8 Flash 称为 workhorse model,强调速度、成本和大规模部署。Muse Spark 1.3 虽然是 Meta 当前能力最强的公开模型,Meta 的路线图里仍有更大的模型;得分更高的 max 版本也只向少数合作伙伴开放。

两家公司眼下都缺少一款能够稳稳进入最高一档竞争的旗舰。Google 的 Gemini 3.5 Pro 仍在测试,Gemini 4 刚开始预训练;Meta 则在 Muse Spark 之外预告了更大的后续模型。

Artificial Analysis 的数据反映了这一点。Claude Fable 5.1 max 得到 66 分,Muse Spark 1.3 max 为 62 分,公开可用的 xhigh 与 GPT-5.6 Sol max 同为 61 分,Gemini 3.8 Flash high 为 59 分。

Meta 已经能够在单项综合评测中追平 Sol,但还没有形成稳定的旗舰优势;Google 最新公开模型与榜首之间的差距则更明显。两家公司暂时都很难只靠“最强模型”赢得竞争,速度和性价比因此变得更重要。

Gemini 3.8 Flash high 的输出速度约为每秒 302 个 token,Muse Spark 1.3 xhigh 约为每秒 182 个 token。Gemini 的首 token 延迟也更低,适合需要快速响应和高吞吐量的工作流。

Google 给 3.8 Flash 设定的推广期价格为每百万输入 token 0.75 美元、输出 token 3.75 美元;Muse Spark 1.3 的相应价格为 1.25 美元和 4.25 美元。按照 token 标价计算,Gemini 更便宜。

按照 Artificial Analysis 的实际任务消耗计算,Muse Spark 1.3 xhigh 完成一次综合评测任务平均花费 0.55 美元,Gemini 3.8 Flash high 为 0.58 美元。Meta 的 token 标价更高,却在这组任务中以较少的总消耗抵消了差价。


(来源:Artificial Analysis)

两款模型都进入了 Intelligence vs. Cost per Task (智能水平与单任务成本)的帕累托前沿。Google 的优势是输出速度和 token 单价,Meta 的优势是以略低的单任务成本取得了更高的综合分数。它们提供的差异化,都建立在性能、速度和成本的平衡上。

能力提升也集中在相近的地方。Gemini 3.8 Flash 得分上涨,主要来自 τ³-Banking、Terminal-Bench 2.1 和 GDPval-AA 等 Agent、编程及真实工作任务。其中,τ³-Banking 比上一代提高 12 个百分点。

Muse Spark 1.3 的进步同样集中在 Agent 评测:xhigh 版本在 τ³-Banking 上从 35% 升至 47%,Terminal-Bench 2.1 从 80% 升至 85%,GDPval-AA 的 Elo 分数也从 1615 升至 1709。

两家公司的官方表述几乎指向同一组任务。Google 强调长程软件工程、自主 Agent 和复杂企业工作流;Meta 强调编程、工具调用、多任务协作,以及在长线程中处理模糊指令。

过去的模型竞争更关心知识问答、聊天和多模态能力。如今,两家公司都在证明模型能否调用工具、理解大型代码库,并在较长时间内完成一项复杂工作。软件工程和 Agent 是更容易进入企业采购、也更容易体现成本差异的场景。

这也是 Gemini 3.8 Flash 和 Muse Spark 1.3 最接近的地方:它们都没有把绝对分数当成唯一目标,而是在争夺一类更高频、更实际的模型需求。

相似的处境,不同的家底

虽然两家公司掏出的成绩可谓不分伯仲,但二者的心境恐怕并不相同。对Meta 来说,这是他们的模型能力和发布速度在向上走,而对 Google 来说,则是他们如今只能在第二梯队中进行较量。

于是我们看到,Muse Spark 1.3 发布后,Alexandr Wang 直接在 X 上转发相关数据并嘲讽道:“Gemini who?”


图丨相关推文(来源:X)

这句挑衅无法证明 Meta 已经超过 Google,却准确抓住了两家公司此刻的相对位置。Meta 已经有能力公开挑战 Gemini,Google 当前拿出来迎战的却是一款 Flash。

放在一年前,他恐怕很难有这个有底气公开把 Gemini 当作比较对象,以这样的口吻说话。

但 Google 的位置也不会因为两分之差突然崩塌。2026 年第二季度,Gemini 应用月活用户已经超过 9.5 亿,Google 模型 API每分钟处理约 220 亿个 token,接近 90% 的《财富》100 强企业使用Gemini Enterprise。TPU、云服务、搜索、Workspace和 Android 也为 Gemini 提供了完整的部署渠道。

Meta 则拥有 Facebook、Instagram、WhatsApp 和 Messenger 等消费产品,但 Muse 系列还在建立开发者生态,也需要继续验证大规模部署后的可靠性。五个月发布四个版本说明团队已经运转良好,距离连续完成多个旗舰训练周期仍有一段路。

这两家公司在组织上的变化也越来越相似。Google 把 Gemini 模型、前沿研究、应用和开发者团队交给 Koray Kavukcuoglu,Meta 把核心模型资源集中到 Alexandr Wang 和 TBD Lab。两家公司都在缩短研究、模型与产品之间的距离,优先解决软件工程、Agent 和复杂工作流等更接近商业使用的问题。

它们面对的压力也相似:在缺少顶尖旗舰的阶段,先依靠更快、更便宜、更容易部署的模型守住市场。

区别在于,Google 正从领先位置回撤到这一竞争区间,Meta 则从落后位置追了上来。Gemini 仍有更成熟的基础设施和产品规模,Muse Spark 拥有更明显的上升势头。

至于他们下一轮较量的谁胜谁负,就得看谁能先补上旗舰的空缺,把一款好用的工作模型继续向上推,拿出足以同 Fable、ChatGPT Sol 正面竞争的产品。

参考资料:

https://www.reuters.com/business/google-shakes-up-ai-leadership-deepmind-chief-shifts-role-2026-08-05/

https://www.reuters.com/business/google-gemini-launch-delayed-tech-falls-short-internal-goals-bloomberg-news-2026-07-16/

https://www.wsj.com/tech/ai/googles-chief-scientist-is-leaving-after-27-yearsto-start-his-own-ai-company-6abad73d

https://www.theverge.com/ai-artificial-intelligence/988742/google-gemini-3-8-flash?utm

https://x.com/alexandr_wang/status/2095266112212754659

https://artificialanalysis.ai/changelog

https://www.axios.com/2026/09/02/meta-debuts-muse-spark-13-as-personal-agent-work-continues

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
自导自演“打磨芯片”栽赃华为,被光速打脸后,那照妖镜照出了谁

自导自演“打磨芯片”栽赃华为,被光速打脸后,那照妖镜照出了谁

潋滟晴方DAY
2026-09-05 14:42:12
CCTV5直播,中国男篮VS哈萨克斯坦,赢球不难,郭士强做好三件事

CCTV5直播,中国男篮VS哈萨克斯坦,赢球不难,郭士强做好三件事

体坛小快灵
2026-09-10 10:17:47
1.17 亿血赚!切尔西新王封神一战!名宿彻底看傻眼

1.17 亿血赚!切尔西新王封神一战!名宿彻底看傻眼

澜归序
2026-09-10 09:41:16
股价暴跌95%、两位CEO下台,这家5000亿巨头在10年后“活过来”了

股价暴跌95%、两位CEO下台,这家5000亿巨头在10年后“活过来”了

钛媒体APP
2026-09-07 17:19:07
卫星图像显示,在美国战争威胁下,伊朗“镐山”核设施建设激增

卫星图像显示,在美国战争威胁下,伊朗“镐山”核设施建设激增

泪满过眼
2026-09-10 09:39:08
限时“秋凉”将到期,明起气温回升30℃以上区域增多

限时“秋凉”将到期,明起气温回升30℃以上区域增多

北青网-北京青年报
2026-09-10 09:29:07
iPhone Duo 大圆角设计真丑!黔驴技穷,苹果早就不行了

iPhone Duo 大圆角设计真丑!黔驴技穷,苹果早就不行了

喜爱的CAD
2026-09-10 10:42:16
台湾方面频繁针对爱奇艺、小红书、螺蛳粉、张雪机车及瑞幸咖啡等入台进行严格审查,国台办:是不得人心的政治操弄

台湾方面频繁针对爱奇艺、小红书、螺蛳粉、张雪机车及瑞幸咖啡等入台进行严格审查,国台办:是不得人心的政治操弄

政知新媒体
2026-09-09 14:04:45
欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

狍子歪解体坛
2026-09-10 04:57:39
谢婷婷罕见发声,揭开前嫂子张柏芝真面目,与网络传言天差地别

谢婷婷罕见发声,揭开前嫂子张柏芝真面目,与网络传言天差地别

看尽落尘花q
2026-08-04 15:28:11
刘翔晒工资明细:退役11年合计98万元,月均7000元

刘翔晒工资明细:退役11年合计98万元,月均7000元

南方都市报
2026-09-10 14:03:20
房地产的中产阶级,正在消失

房地产的中产阶级,正在消失

地产大爆炸
2026-09-09 21:47:15
金砖峰会将开幕,普京已确定参会,印度放出风声,对中国有事相求

金砖峰会将开幕,普京已确定参会,印度放出风声,对中国有事相求

三石记
2026-09-09 13:29:36
拉夫罗夫向全球交底:中俄永不结盟,俄罗斯绝不当中国小跟班

拉夫罗夫向全球交底:中俄永不结盟,俄罗斯绝不当中国小跟班

精彩启程
2026-09-10 13:01:06
前苏联外交官回忆:1949年高岗访苏,曾建议斯大林将东北纳入苏联版图

前苏联外交官回忆:1949年高岗访苏,曾建议斯大林将东北纳入苏联版图

凉州辞
2026-09-10 06:00:03
东莞通报:高伟文严重违纪违法,被开除党籍和公职

东莞通报:高伟文严重违纪违法,被开除党籍和公职

南方都市报
2026-09-10 14:18:31
研究员评价麒麟9050 Pro:达到了一个制程落后,但性能领先的格局。不过逻辑折叠只是增效方案,我们需要突破先进制程

研究员评价麒麟9050 Pro:达到了一个制程落后,但性能领先的格局。不过逻辑折叠只是增效方案,我们需要突破先进制程

逍遥漠
2026-09-09 11:43:02
这是啥安排?女篮扛旗人2场不打,球迷:留在板凳做思想工作吗?

这是啥安排?女篮扛旗人2场不打,球迷:留在板凳做思想工作吗?

南海浪花
2026-09-10 07:24:32
甜美女神金晨:美若天仙,国色天香。沉鱼落雁,闭月羞花!

甜美女神金晨:美若天仙,国色天香。沉鱼落雁,闭月羞花!

十为先生
2026-09-10 14:26:53
我85岁才明白:永远不要在兄弟姐妹面前,随口说出5句话,切记

我85岁才明白:永远不要在兄弟姐妹面前,随口说出5句话,切记

黄家湖的忧伤
2025-07-04 17:25:58
2026-09-10 15:56:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17221文章数 515211关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

22岁女子与男友吵架后投江身亡:生前被迫写"卖身契"

头条要闻

22岁女子与男友吵架后投江身亡:生前被迫写"卖身契"

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

重磅!金融强国建设“十五五”规划出台

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

教育
旅游
时尚
健康
公开课

教育要闻

刘鹓看望慰问一线教师

旅游要闻

视频丨“这里太棒了!”英国博主来华观光后强烈推荐“中国游”

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

牙疼,也可能跟心梗有关?!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版