整理 | 屠敏
出品 | CSDN(ID:CSDNnews)
这两天,AI 领域热闹非凡,大模型市场迎来了一轮密集更新。
9 月 1 日,Anthropic 刚刚发布 Claude Fable 5.1 和 Claude Mythos 5.1,主打编码、知识工作和长时间 Agent 任务。紧接着,Google 和 Meta 也在同一时间带来新模型:Google 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,Meta 则发布 Muse Spark 1.3。
短短几天,三家头部 AI 公司接连出手,而且不约而同地把重点放在了编码、Agent 和复杂任务执行上。大模型的竞争,正在从单纯比拼“谁的回答更聪明”,进一步转向比拼谁能真正把事情做完。
![]()
仅三周,Gemini 3.8 Flash 就来了
回看 Gemini 3.7 Flash 版本的发布,也只不过是三周前的事情。
如今 Google 加快了模型版本迭代的步伐,最新带来了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。官方表示,这是目前最智能的 Flash 模型,重点提升软件工程、Agent 任务和多步骤推理能力。
![]()
其中,Gemini 3.8 Flash 最大的特点,是在保持 Flash 系列速度和成本优势的同时,开始向更高能力的模型靠近。
![]()
它支持 100 万 Token 上下文,输入价格为每百万 Token 0.75 美元,输出为3.75 美元。模型还支持低、中、高三档 thinking 强度,可以在性能、延迟和成本之间进行调整。
在 DeepSWE v1.1 这一长程软件工程测试中,Google 自己公布的数据显示,Gemini 3.8 Flash 可以自主处理复杂工程问题。
![]()
在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 等专业 Agent 测试中也超过上一代。HLE-Verified 得分则达到 54.9%,证明了其能够处理 STEM、人文和专业领域的多步骤推理。
![]()
第三方测试同样给出了不错的结果。
Artificial Analysis 测试显示,Gemini 3.8 Flash 在最高推理强度下拿到 59分,比 Gemini 3.7 Flash 的 56 分提高 3 分;中等推理强度为 57 分,低推理强度为 52 分。
这与 Anthropic 的 GPT-5.6 Sol和 SpaceXAI 的 Grok 4.6 仅差一点。
![]()
不过,Google 也很坦率:3.8 Flash 会“想得更多”。
在处理复杂任务时,这款模型会表现得更加细致,会增加推理步骤,并反复调用工具。有时,为了尽可能提升任务表现,模型会消耗更多 Token,尤其是在更高推理强度下。
Google 对此建议道:对于算力效率是首要考量的应用场景,开发者可以选择较低的推理强度,以减少 Token 开销;也可以继续使用 Gemini 3.7 Flash。后者目前仍得到完整支持,适合那些更看重效率和成本的工作负载。
![]()
Gemini 3.8 Flash Cyber:Google 把网络安全单独拎出来
随着 Gemini 3.8 Flash 一起发布的,还有 Gemini 3.8 Flash Cyber,同样值得关注。
这个版本不是面向普通用户的“加强版 Gemini”,而是专门用于网络安全防御,目前通过 Google 新推出的 Fairwind Program 提供给一组受信任的防御者。
Google 重点测试了两个能力:发现漏洞和自动修复漏洞。
在用于查找漏洞的行业标准基准测试 CyberGym中,Gemini 3.8 Flash Cyber达到前沿水平,并超过了 Gemini 3.5 Flash Cyber 以及更大的模型。
![]()
在 CWE-Bench 漏洞修复测试中,模型 pass@1 达到 47.2%,与领先前沿模型的 47.8% 非常接近,但 Google 强调其成本明显更低。更直接的例子来自实际使用:Chrome 安全团队发现,3.8 Flash Cyber 生成的正确漏洞补丁数量,是体量更大的商业模型中最佳结果的 2.6 倍。
![]()
Google 还披露,Cloud Vulnerability Research 团队利用该模型在不到 2 小时内发现了一个关键基础漏洞,而这类漏洞通常可能需要数月研究。
当然,这一能力也意味着更严格的访问控制。Google 表示,Gemini 3.8 Flash 已经加入针对网络攻击和 CBRN 相关滥用的安全措施,而 Cyber 版本因为需要提供更完整的网络安全能力,因此只开放给可信防御方。
![]()
Meta Muse Spark 1.3 同台竞技,Alexandr Wang 调侃:“Gemini 是谁?”
同一天,Meta AI Research 也拿出了 Muse Spark 1.3,是继今年 8 月发布 Muse Spark 1.2 后,短时间内再次升级的一代模型。
一直热衷于为自家模型“站台”的 Meta AI 负责人 Alexandr Wang,在新模型发布后也不忘调侃一番,直接在社交平台上发问:“我真不想这么说,但是……Gemini 是谁?”
![]()
相比 Google 和 Anthropic 此前更明显的模型升级,Meta 这次并没有改变 Muse Spark 的定位,而是继续围绕 Agent 和编程能力加码。
官方表示,Muse Spark 1.3 重点提升了 Agentic 任务和编程任务的表现,并针对真实使用场景进行了大量优化,让模型不仅在测试中表现更好,也能更稳定地处理需要多步骤执行的复杂任务。
![]()
详细来看,Muse Spark 1.3 针对 Agent 和编码任务进行了优化,可以在一个较长的对话线程中同时处理多个工作流。面对开放式任务,它能够利用工具收集上下文、发现计划中的缺口并主动修正,同时在任务过程中记住已经获得的信息。
这种能力在实际工作中尤其重要。比如用户要求模型根据 CFD 仿真数据和 CAD 文件制作一份航空工程报告,Muse Spark 1.3 不仅需要读取不同类型的输入,还要提取仿真数据、整理性能指标、生成表格、分析气动性能,最后按照指定结构输出 PDF。
![]()
Meta 展示的另一个案例则要求模型处理音频工程任务,根据时间码定位贝斯轨道中的错误音符、噪声和爆音,再完成编辑和混音。
![]()
在与用户协作方面,Muse Spark 1.3 也进行了优化。面对存在歧义的要求,模型会主动请求澄清;执行过程中遇到无法解决的问题时,也可以向用户寻求帮助,并在执行重要操作前进行确认。
对于长时间任务,它还可以根据场景选择持续汇报进度,或者尽量减少打扰,在后台完成工作。
编程也是此次升级的重点。Meta 表示,Muse Spark 1.3 针对长周期编码任务和常见软件工程工作流进行了优化,在没有必要的情况下会减少交互轮次,同时让代码更加简洁。
根据 Meta 工程师的测试,在相同类型的任务中,Muse Spark 1.3 相比 Muse Spark 1.2 的工具调用次数减少约 20%,Token 使用量减少约 25%。这意味着新模型并非单纯依靠更多推理和工具调用完成任务,而是在减少无效操作的同时提高执行效率。
![]()
安全方面,Muse Spark 1.3 也针对 Agent 和编码场景进行了优化,包括增强对抗恶意输入和 Prompt Injection(提示词注入)的能力,并改进对高风险、不可逆操作的判断,在必要情况下会暂停执行并请求用户确认。
目前,Muse Spark 1.3 已经上线 Muse Code 和 Meta Model API。此前提供的推理模式现已开放,而更高强度的 Max Reasoning 模式将在完成额外安全测试后推出。
对于这一新版本,Alexandr Wang 表示,这一升级也是 Meta 继续推进“个人 Agent”的一部分,目标是让 Agent 未来能够长期运行,替用户完成任务。
![]()
不同模型碰到一起,真正比的是“干活能力”
事实上,把这几款模型放在一起看,会发现一个很明显的变化。
这轮新品已经很难单纯用“谁的模型更聪明”来概括。
Claude Fable 5.1 目前在 Artificial Analysis 综合智能指数上以 66 分排名第一,它的优势集中在复杂推理、编码和专业知识工作,但最高强度下也会消耗大量 Token。
Gemini 3.8 Flash 则更像一个高性价比的“工作马”。最高推理强度下达到 59 分,开发者还可以主动降低 thinking 强度,把单任务成本进一步压低。
Muse Spark 1.3 则把重点放在长任务执行效率上。它不只是提高模型本身的能力,还试图让 Agent 少调用几次工具、少消耗一些 Token,并在复杂任务中更好地保持上下文和执行约束。
这也是为什么最近模型发布越来越频繁,却越来越不像过去那种简单的“刷榜”。
![]()
模型已经开始进入一个新的竞争阶段:不仅要回答得对,还要能连续工作;不仅要能写代码,还要能自己运行、测试和修改;不仅要完成任务,还得控制完成任务的 Token 和时间成本。
从这个角度看,Anthropic、Google 和 Meta 这几款新品虽然走的是不同方向,但最终瞄准的是同一个问题——当大模型不再只是聊天机器人,而是开始真正替用户执行任务时,谁能让它们干得更久、更稳、更快,而且成本还能接受。
接下来大模型赛道的竞争真正值得看的,可能已经不是下一款模型能把榜单提高几分,而是这些模型进入真实工作流之后,究竟谁能最先把“Agent 自己干活”从演示变成日常工具。
参考:
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/ArtificialAnlys/status/2095247787277553929/photo/1
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
https://artificialanalysis.ai/articles/gemini-3-8-flash?utm_source=chatgpt.com
https://artificialanalysis.ai/-breakdown
文末福利|AI 开学季硬核资料免费领
2026 奇点智能技术大会限时送出两份技术礼包:
Łukasz Kaiser 历届演讲视频 + PPT
Transformer 八子之一、OpenAI 资深研究科学家,带你理解推理模型与大模型第一性原理。
Agent 实战训练营录播课
覆盖 Agent 架构、基座模型、Skill、Agentic Infra 等核心技术,从理论到企业级落地。
扫码免费领取,两套硬核资料一次带走。
11 月 20—21 日
北京万达文华酒店
2026 奇点智能技术大会,现场见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.