网易首页 > 网易号 > 正文 申请入驻

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

0
分享至


新智元报道


太卷了。

九月才过去3天,就已经有五个前沿模型发布了!

Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。

就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。

小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃!


Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。

他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。


Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。

跑分显示,这次 Muse Spark 1.3 的提升更大。

它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。


在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。

亚历山大王嘲讽谷歌

「吸别家模型尾气」

最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。

Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。

在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。

Muse Spark 1.3:75.4 分

Claude Opus 5:74.0 分

GPT-5.6 Sol:73.0 分


不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。

在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。

在Terminal-Bench 2.1它拿下88.8 分。

在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。


在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。


在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。

在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。


而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。

面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」

谷歌真是虎落平阳。


有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」


Less is More:1美元跑2小时的性能怪兽

跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。

Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。

正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。



它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。

针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。


它变得更聪明利落,代码风格更干净,废话更少。

而这种减法带来的直接后果,就是成本的断崖式下跌。

下面就是一个非常震撼的真实实测案例。

开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。


他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。

这两个模型都运行了大约 2 个小时,结果惊人。

Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。

而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!


这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」

在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。


在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。)


Codedamn创始人、开发者Mehul Mohan直呼:

Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。


在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。

作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。

甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。

它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。


Alexandr Wang的狂飙,小扎的终极野心

Muse Spark 1.3 的横空出世,离不开其背后的操盘手。

今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。

短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。

如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。

他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。

也就是说,Meta看下一个ASI风口——「智能体工程」。

Meta AI负责人Alexandr Wang在接受Axios采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。


要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。

1.极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。

当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。

2.极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。

Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。

它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。

为此,北大校友、Meta研究员孙之清透露Meta团队对此前的牛油果avocado模型再次后训练,实现了更好的测试scaling。


狂欢背后:我们被「刷榜」骗了吗?

不过,Muse Spark 1.3也同样受到了质疑。

知名 AI 机构 BridgeMind发了一段引人深思的话:

Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。

Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。

因为,这个月的AI发布如出一辙,分数飙升,真实世界的体验却毫无长进。

这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。


这段话,精准地击中了当前大模型行业的痛点。

有网友对Muse Spark 1.3、Gemini Flash 3.8z在后端级3D约束下做了压力测试,结果两个模型的老底都被揭穿了:

Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。


现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。

DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。

而Muse Spark 1.3 也露出了马脚。

在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。

比如,在 AA-Omniscience测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。

这降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分提升得那么夸张。


大模型的下半场,到底比什么?

今天 Muse Spark 1.3和Gemini 3.8 Flash的发布,可以让我们得出以下几个判断。

首先,基座模型的「参数红利」正在见顶。

单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。

未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做极致的「减法」,谁就能获得真正的体验跃升。

另外,「智能体工程」才是胜负手。

大模型之争,已经从「谁更会说话」转向「谁更能干活」。

未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。

像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。

参考资料:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

编辑:Aeneas

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
属牛人当心,你今年最大的坎,可能就坐在你家中

属牛人当心,你今年最大的坎,可能就坐在你家中

叮当当科技
2026-09-11 16:22:43
徐洁云确认,试驾小米澎程汽车误将油门当刹车的用户已锁单

徐洁云确认,试驾小米澎程汽车误将油门当刹车的用户已锁单

IT之家
2026-09-12 10:47:22
苹果又保守了?A20 Pro跑分曝光:性能超官方宣传,直逼桌面级M系列

苹果又保守了?A20 Pro跑分曝光:性能超官方宣传,直逼桌面级M系列

泡泡网
2026-09-11 16:43:59
不装喷嘴,特斯拉用一块塑料解决摄像头雨天失灵

不装喷嘴,特斯拉用一块塑料解决摄像头雨天失灵

字节漫游指南
2026-09-10 15:03:50
这四个我们天天用的汉字,居然是近代才创造出来的,普及不过百年

这四个我们天天用的汉字,居然是近代才创造出来的,普及不过百年

长风文史
2026-09-09 20:54:32
冠军生变?韦世豪禁赛4场,成都蓉城需谨慎,联赛冠军很稳

冠军生变?韦世豪禁赛4场,成都蓉城需谨慎,联赛冠军很稳

祥谈体育
2026-09-12 19:00:55
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
巴西老帅费雷蒂:安切洛蒂已经“死了”,巴西足协留他蠢透了

巴西老帅费雷蒂:安切洛蒂已经“死了”,巴西足协留他蠢透了

懂球帝
2026-09-12 00:19:16
30岁贺子珍真实容貌,不是演员扮演,照片背后是一段十年异国苦旅

30岁贺子珍真实容貌,不是演员扮演,照片背后是一段十年异国苦旅

乡野小珥
2026-09-11 03:30:46
两制方案公开!国台办与台陆委会先后表态,大方讨论统一后的问题

两制方案公开!国台办与台陆委会先后表态,大方讨论统一后的问题

影孖看世界
2026-09-11 22:41:58
征地基本完成!广西这条“受阻”的高速,拟10月开工,不怕再堵车

征地基本完成!广西这条“受阻”的高速,拟10月开工,不怕再堵车

小影的娱乐
2026-09-12 13:23:58
陈自瑶亲口承认没离婚,为挽救14岁叛逆女儿选择重归于好!

陈自瑶亲口承认没离婚,为挽救14岁叛逆女儿选择重归于好!

草莓解说体育
2026-09-12 10:36:17
1986年,胡耀邦告诫胡启立:你记住,我们共产党人任何时候绝不能鱼肉人民

1986年,胡耀邦告诫胡启立:你记住,我们共产党人任何时候绝不能鱼肉人民

帝哥说史
2026-09-08 20:29:00
中国男篮105-59巴林男篮  球员评价:3人满分,6人及格,2人低迷

中国男篮105-59巴林男篮 球员评价:3人满分,6人及格,2人低迷

篮球资讯达人
2026-09-12 17:05:12
电讯报:哈维要求与范戴克再次会面,就其国家队前景进行交流

电讯报:哈维要求与范戴克再次会面,就其国家队前景进行交流

懂球帝
2026-09-12 07:46:08
上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

报错免疫体
2026-09-11 00:30:16
实际上,只有中国人才会这么奢侈用电车!

实际上,只有中国人才会这么奢侈用电车!

米粒说车唯一呀
2026-09-11 13:40:24
10场27分!曼联主场变堡垒,曼城想抢分先过这关

10场27分!曼联主场变堡垒,曼城想抢分先过这关

慢享生活集
2026-09-12 19:31:51
48美元运动内衣被明星穿出门,有买家称买了5件

48美元运动内衣被明星穿出门,有买家称买了5件

娱圈观察员
2026-09-11 17:16:06
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

八卦王者
2026-09-09 14:23:41
2026-09-12 19:52:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16168文章数 67063关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

被5执法部门前后检查15次店主:是有人举报后上门检查

头条要闻

被5执法部门前后检查15次店主:是有人举报后上门检查

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

教育
旅游
亲子
房产
公开课

教育要闻

是题目超纲了,还是出错了呢?

旅游要闻

奔“县”游|到秦岭腹地,去“邂逅”野生大熊猫

亲子要闻

6岁中韩双胞胎萌娃识汉字,一个爱教,一个爱学,小模样太可爱了

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版