网易首页 > 网易号 > 正文 申请入驻

AI巨头又开始“互卷”!Google、Meta同时出手:Gemini 3.8、Muse Spark 1.3重磅发布

0
分享至

整理 | 屠敏

出品 | CSDN(ID:CSDNnews)

这两天,AI 领域热闹非凡,大模型市场迎来了一轮密集更新。

9 月 1 日,Anthropic 刚刚发布 Claude Fable 5.1 和 Claude Mythos 5.1,主打编码、知识工作和长时间 Agent 任务。紧接着,Google 和 Meta 也在同一时间带来新模型:Google 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,Meta 则发布 Muse Spark 1.3。

短短几天,三家头部 AI 公司接连出手,而且不约而同地把重点放在了编码、Agent 和复杂任务执行上。大模型的竞争,正在从单纯比拼“谁的回答更聪明”,进一步转向比拼谁能真正把事情做完。


仅三周,Gemini 3.8 Flash 就来了

回看 Gemini 3.7 Flash 版本的发布,也只不过是三周前的事情。

如今 Google 加快了模型版本迭代的步伐,最新带来了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。官方表示,这是目前最智能的 Flash 模型,重点提升软件工程、Agent 任务和多步骤推理能力。


其中,Gemini 3.8 Flash 最大的特点,是在保持 Flash 系列速度和成本优势的同时,开始向更高能力的模型靠近。


它支持 100 万 Token 上下文,输入价格为每百万 Token 0.75 美元,输出为3.75 美元。模型还支持低、中、高三档 thinking 强度,可以在性能、延迟和成本之间进行调整。

在 DeepSWE v1.1 这一长程软件工程测试中,Google 自己公布的数据显示,Gemini 3.8 Flash 可以自主处理复杂工程问题。


在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 等专业 Agent 测试中也超过上一代。HLE-Verified 得分则达到 54.9%,证明了其能够处理 STEM、人文和专业领域的多步骤推理。


第三方测试同样给出了不错的结果。

Artificial Analysis 测试显示,Gemini 3.8 Flash 在最高推理强度下拿到 59分,比 Gemini 3.7 Flash 的 56 分提高 3 分;中等推理强度为 57 分,低推理强度为 52 分。

这与 Anthropic 的 GPT-5.6 Sol和 SpaceXAI 的 Grok 4.6 仅差一点。


不过,Google 也很坦率:3.8 Flash 会“想得更多”。

在处理复杂任务时,这款模型会表现得更加细致,会增加推理步骤,并反复调用工具。有时,为了尽可能提升任务表现,模型会消耗更多 Token,尤其是在更高推理强度下。

Google 对此建议道:对于算力效率是首要考量的应用场景,开发者可以选择较低的推理强度,以减少 Token 开销;也可以继续使用 Gemini 3.7 Flash。后者目前仍得到完整支持,适合那些更看重效率和成本的工作负载。


Gemini 3.8 Flash Cyber:Google 把网络安全单独拎出来

随着 Gemini 3.8 Flash 一起发布的,还有 Gemini 3.8 Flash Cyber,同样值得关注。

这个版本不是面向普通用户的“加强版 Gemini”,而是专门用于网络安全防御,目前通过 Google 新推出的 Fairwind Program 提供给一组受信任的防御者。

Google 重点测试了两个能力:发现漏洞和自动修复漏洞。

在用于查找漏洞的行业标准基准测试 CyberGym中,Gemini 3.8 Flash Cyber达到前沿水平,并超过了 Gemini 3.5 Flash Cyber 以及更大的模型。


在 CWE-Bench 漏洞修复测试中,模型 pass@1 达到 47.2%,与领先前沿模型的 47.8% 非常接近,但 Google 强调其成本明显更低。更直接的例子来自实际使用:Chrome 安全团队发现,3.8 Flash Cyber 生成的正确漏洞补丁数量,是体量更大的商业模型中最佳结果的 2.6 倍。


Google 还披露,Cloud Vulnerability Research 团队利用该模型在不到 2 小时内发现了一个关键基础漏洞,而这类漏洞通常可能需要数月研究。

当然,这一能力也意味着更严格的访问控制。Google 表示,Gemini 3.8 Flash 已经加入针对网络攻击和 CBRN 相关滥用的安全措施,而 Cyber 版本因为需要提供更完整的网络安全能力,因此只开放给可信防御方。


Meta Muse Spark 1.3 同台竞技,Alexandr Wang 调侃:“Gemini 是谁?

同一天,Meta AI Research 也拿出了 Muse Spark 1.3,是继今年 8 月发布 Muse Spark 1.2 后,短时间内再次升级的一代模型。

一直热衷于为自家模型“站台”的 Meta AI 负责人 Alexandr Wang,在新模型发布后也不忘调侃一番,直接在社交平台上发问:“我真不想这么说,但是……Gemini 是谁?”


相比 Google 和 Anthropic 此前更明显的模型升级,Meta 这次并没有改变 Muse Spark 的定位,而是继续围绕 Agent 和编程能力加码。

官方表示,Muse Spark 1.3 重点提升了 Agentic 任务和编程任务的表现,并针对真实使用场景进行了大量优化,让模型不仅在测试中表现更好,也能更稳定地处理需要多步骤执行的复杂任务。


详细来看,Muse Spark 1.3 针对 Agent 和编码任务进行了优化,可以在一个较长的对话线程中同时处理多个工作流。面对开放式任务,它能够利用工具收集上下文、发现计划中的缺口并主动修正,同时在任务过程中记住已经获得的信息。

这种能力在实际工作中尤其重要。比如用户要求模型根据 CFD 仿真数据和 CAD 文件制作一份航空工程报告,Muse Spark 1.3 不仅需要读取不同类型的输入,还要提取仿真数据、整理性能指标、生成表格、分析气动性能,最后按照指定结构输出 PDF。


Meta 展示的另一个案例则要求模型处理音频工程任务,根据时间码定位贝斯轨道中的错误音符、噪声和爆音,再完成编辑和混音。


在与用户协作方面,Muse Spark 1.3 也进行了优化。面对存在歧义的要求,模型会主动请求澄清;执行过程中遇到无法解决的问题时,也可以向用户寻求帮助,并在执行重要操作前进行确认。

对于长时间任务,它还可以根据场景选择持续汇报进度,或者尽量减少打扰,在后台完成工作。

编程也是此次升级的重点。Meta 表示,Muse Spark 1.3 针对长周期编码任务和常见软件工程工作流进行了优化,在没有必要的情况下会减少交互轮次,同时让代码更加简洁。

根据 Meta 工程师的测试,在相同类型的任务中,Muse Spark 1.3 相比 Muse Spark 1.2 的工具调用次数减少约 20%,Token 使用量减少约 25%。这意味着新模型并非单纯依靠更多推理和工具调用完成任务,而是在减少无效操作的同时提高执行效率。


安全方面,Muse Spark 1.3 也针对 Agent 和编码场景进行了优化,包括增强对抗恶意输入和 Prompt Injection(提示词注入)的能力,并改进对高风险、不可逆操作的判断,在必要情况下会暂停执行并请求用户确认。

目前,Muse Spark 1.3 已经上线 Muse Code 和 Meta Model API。此前提供的推理模式现已开放,而更高强度的 Max Reasoning 模式将在完成额外安全测试后推出。

对于这一新版本,Alexandr Wang 表示,这一升级也是 Meta 继续推进“个人 Agent”的一部分,目标是让 Agent 未来能够长期运行,替用户完成任务。


不同模型碰到一起,真正比的是“干活能力”

事实上,把这几款模型放在一起看,会发现一个很明显的变化。

这轮新品已经很难单纯用“谁的模型更聪明”来概括。

Claude Fable 5.1 目前在 Artificial Analysis 综合智能指数上以 66 分排名第一,它的优势集中在复杂推理、编码和专业知识工作,但最高强度下也会消耗大量 Token。

Gemini 3.8 Flash 则更像一个高性价比的“工作马”。最高推理强度下达到 59 分,开发者还可以主动降低 thinking 强度,把单任务成本进一步压低。

Muse Spark 1.3 则把重点放在长任务执行效率上。它不只是提高模型本身的能力,还试图让 Agent 少调用几次工具、少消耗一些 Token,并在复杂任务中更好地保持上下文和执行约束。

这也是为什么最近模型发布越来越频繁,却越来越不像过去那种简单的“刷榜”。


模型已经开始进入一个新的竞争阶段:不仅要回答得对,还要能连续工作;不仅要能写代码,还要能自己运行、测试和修改;不仅要完成任务,还得控制完成任务的 Token 和时间成本。

从这个角度看,Anthropic、Google 和 Meta 这几款新品虽然走的是不同方向,但最终瞄准的是同一个问题——当大模型不再只是聊天机器人,而是开始真正替用户执行任务时,谁能让它们干得更久、更稳、更快,而且成本还能接受。

接下来大模型赛道的竞争真正值得看的,可能已经不是下一款模型能把榜单提高几分,而是这些模型进入真实工作流之后,究竟谁能最先把“Agent 自己干活”从演示变成日常工具。

参考:

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/ArtificialAnlys/status/2095247787277553929/photo/1

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

https://artificialanalysis.ai/articles/gemini-3-8-flash?utm_source=chatgpt.com

https://artificialanalysis.ai/-breakdown

文末福利|AI 开学季硬核资料免费领

2026 奇点智能技术大会限时送出两份技术礼包:

Łukasz Kaiser 历届演讲视频 + PPT

Transformer 八子之一、OpenAI 资深研究科学家,带你理解推理模型与大模型第一性原理。

Agent 实战训练营录播课

覆盖 Agent 架构、基座模型、Skill、Agentic Infra 等核心技术,从理论到企业级落地。

扫码免费领取,两套硬核资料一次带走。

11 月 20—21 日

北京万达文华酒店

2026 奇点智能技术大会,现场见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
哪个瞬间,你突然就释怀了?网友:有时候老天爷也会给你征兆,再三阻止你走向命运的另一边

哪个瞬间,你突然就释怀了?网友:有时候老天爷也会给你征兆,再三阻止你走向命运的另一边

带你感受人间冷暖
2026-09-02 00:11:31
星宇股份栽了,但30万失业光伏人仍在苦熬!

星宇股份栽了,但30万失业光伏人仍在苦熬!

老杨说光伏
2026-09-03 23:03:48
闹大了?网友嘲讽“缝合诗”太尬,当场炸出烽火戏诸侯本人

闹大了?网友嘲讽“缝合诗”太尬,当场炸出烽火戏诸侯本人

国创漫话
2026-09-03 22:52:15
几块钱的茭白,是“控糖高手”?医生:多吃有5好处,不懂太可惜

几块钱的茭白,是“控糖高手”?医生:多吃有5好处,不懂太可惜

医学科普汇
2026-09-03 17:55:10
菲律宾弹劾案里程碑事件!检方正考虑放弃贿赂弹劾条款,莎拉躺赢

菲律宾弹劾案里程碑事件!检方正考虑放弃贿赂弹劾条款,莎拉躺赢

温读史
2026-09-04 02:07:41
全球最大岛礁被我国收回:面积相当于四个深圳,曾遭美菲合力抢夺

全球最大岛礁被我国收回:面积相当于四个深圳,曾遭美菲合力抢夺

瓦伦西亚月亮
2026-08-30 05:02:05
杭州电梯诬告事件升级!涉事女子背后的护肤品牌被扒,该品牌长期主打全女创业团队叙事,收获数万粉丝

杭州电梯诬告事件升级!涉事女子背后的护肤品牌被扒,该品牌长期主打全女创业团队叙事,收获数万粉丝

火山詩话
2026-09-03 07:54:17
景甜和孙宇晨的微指被清空,所有热搜全部被下,上一个人还是某爽

景甜和孙宇晨的微指被清空,所有热搜全部被下,上一个人还是某爽

芊手若
2026-09-02 23:51:12
38岁的景甜,经历了“资源咖”的嘲讽、张继科的风波、孙宇晨的官司——但她还在营业,还在笑

38岁的景甜,经历了“资源咖”的嘲讽、张继科的风波、孙宇晨的官司——但她还在营业,还在笑

禁止读书
2026-09-03 00:16:44
井柏然翻红了?话不能说太早!

井柏然翻红了?话不能说太早!

影视地平线
2026-09-03 14:48:21
特朗普虽然平时不着调,但有句话说得贼扎心!他说,咱美国,一战赢了,二战也赢了,成了世界老大。可之后呢?朝鲜、越南、……没赢过一场

特朗普虽然平时不着调,但有句话说得贼扎心!他说,咱美国,一战赢了,二战也赢了,成了世界老大。可之后呢?朝鲜、越南、……没赢过一场

扶苏聊历史
2026-08-28 18:04:18
阴毛有什么用?可以剃掉吗?阴毛变白,暗示了什么?男女都需知道

阴毛有什么用?可以剃掉吗?阴毛变白,暗示了什么?男女都需知道

健康之光
2026-07-29 09:18:07
王夫人给了刘姥姥100两银子,为何却要叮嘱她“别再投亲靠友”了?

王夫人给了刘姥姥100两银子,为何却要叮嘱她“别再投亲靠友”了?

如玉公子
2026-08-09 08:00:05
女人见面的最高礼仪,就是穿裙子,这是对你的重视,对约会的重视

女人见面的最高礼仪,就是穿裙子,这是对你的重视,对约会的重视

加油丁小文
2026-09-01 07:09:58
这豆子不起眼,却比黄芪补气,比当归补血,老人要常吃!

这豆子不起眼,却比黄芪补气,比当归补血,老人要常吃!

华庭讲美食
2026-09-04 03:23:12
“比C罗还猛”?沃特金斯首秀破门后语出惊人:沙特超已达英超水平!

“比C罗还猛”?沃特金斯首秀破门后语出惊人:沙特超已达英超水平!

智道足球
2026-09-03 09:48:31
小心!欧洲被打服了,中东也不闹了,美国的目标只剩下东亚

小心!欧洲被打服了,中东也不闹了,美国的目标只剩下东亚

西府赵王爷
2025-03-22 15:47:18
故事:聂磊称霸青岛十几年,最后因惹上一个女人,踢到铁板就此灭亡

故事:聂磊称霸青岛十几年,最后因惹上一个女人,踢到铁板就此灭亡

红豆讲堂
2024-12-17 10:54:23
今年“喜事连连”属鸡人:9月15到10月底,家里要发生3件事,别大意

今年“喜事连连”属鸡人:9月15到10月底,家里要发生3件事,别大意

阿龙美食记
2026-09-03 06:06:21
央妈“摸排”结果:全国能一次性拿出50万的家庭,数量超乎想象!

央妈“摸排”结果:全国能一次性拿出50万的家庭,数量超乎想象!

平说财经
2026-08-29 07:39:18
2026-09-04 04:44:49
CSDN incentive-icons
CSDN
成就一亿技术人
26920文章数 242321关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

家居
亲子
艺术
旅游
游戏

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

大人刚喝完酒,千万不要去靠近宝宝!

艺术要闻

他画中的女人只露出一半侧脸,却让无数男人盯着看了整整三分钟,秘密全在光影里……

旅游要闻

公告!忻州云中河温泉旅游度假区足球场9月6日、13日、27日暂时关闭

《食人鲨2》正式公布!新预告亮相 2027年发售

无障碍浏览 进入关怀版