![]()
作者 | 山竹
出品 | 锌产业
7月21日,谷歌一口气推出三款Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的Gemini 3.5 Flash Cyber。
这三款模型试图讲述的是不同的故事:
Gemini 3.6 Flash强调更高的Token效率和更强的编程能力;
Gemini 3.5 Flash-Lite瞄准需要海量调用的智能体与文档处理任务;
Gemini 3.5 Flash Cyber则进入漏洞发现和修复这一高度专业、也更加敏感的领域。
它们的共同点是“轻”,谷歌希望用更低的调用成本、更短的任务耗时,让AI智能体真正跑进企业的生产环境。
但发布名单里,依然没有外界等待已久的Gemini 3.5 Pro。
这让此次发布呈现出一种微妙的反差:
当行业仍在等待谷歌拿出更强的旗舰模型时,谷歌先回答了另一个越来越现实的问题——当AI开始大规模干活,企业究竟要为每一次任务付多少钱?
01 Flash三连发
三款模型中,Gemini 3.6 Flash承担着主力角色。
按照谷歌的定位,它主要面向编程、知识工作和多模态任务,与5月发布的3.5 Flash相比,3.6 Flash减少了不必要的推理步骤、工具调用和执行循环,试图让模型用更少的Token完成同一项工作。
谷歌称,3.6 Flash的输出Token消耗较3.5 Flash减少17%。
在DeepSWE测试中,其得分从37%提升至49%,在衡量计算机操作能力的OSWorld-Verified测试中,得分则由78.4%升至83%。
![]()
与此同时,模型的价格也随之下调,3.6 Flash每百万输入Token价格仍为1.5美元,输出价格由3.5 Flash的9美元降至7.5美元。
不过,这次升级更像一次效率优化,而非基础智能的明显跃迁。
第三方评测机构Artificial Analysis给出的结果显示,3.6 Flash与3.5 Flash在其智能指数上均为50分,前者的平均任务耗时却从2.7分钟降至1.3分钟,单次任务成本也下降约18%。
换句话说,3.6 Flash未必变得聪明很多,但干活更快、更简洁,也更便宜了。
Gemini 3.5 Flash-Lite则进一步压低了使用门槛。
它是Gemini 3.5系列中速度最快、价格最低的模型,面向智能体搜索、文档解析、数据提取和子智能体执行等高吞吐量任务。谷歌援引Artificial Analysis的测试称,其输出速度达到每秒350Token。
![]()
3.5 Flash-Lite每百万输入、输出Token的价格分别为0.3美元和2.5美元。它不追求处理最复杂的问题,而是希望在一套智能体系统中承接数量庞大、难度相对有限的基础任务。
第三款模型3.5 Flash Cyber更为特殊。
它基于3.5 Flash微调,专门用于查找、验证和修复软件漏洞。谷歌的CodeMender安全智能体可以同时调用多个3.5 Flash Cyber子智能体,扫描不同代码路径,最后合并成一份报告。
在谷歌针对V8 JavaScript引擎进行的内部测试中,3.5 Flash Cyber发现了55个经确认的独立问题。
作为对比,谷歌称3.5 Flash和Claude Opus 4.6分别发现47个和36个。
但由于网络安全能力具有明显的双重用途,3.5 Flash Cyber不会像另外两款模型一样全面开放,谷歌计划先通过CodeMender向政府和可信合作伙伴提供有限试用,再决定后续开放范围。
02 模型战开始算账
过去的大模型发布会,总要回答“谁更聪明”。
基准测试分数、数学推理、编程能力和上下文窗口,构成了厂商争夺技术领先位置的主要指标,但随着AI智能体开始进入真实业务,另一个问题正变得更加重要:
完成一次任务,需要调用多少次模型、消耗多少Token,又要花多长时间?
一项普通的聊天请求,可能只需要模型生成一次答案。
智能体任务却往往包含规划、搜索、调用工具、检查结果和反复修改,一套多智能体系统还可能将任务拆给多个子模型,单次调用看似微小的成本差异,经过数十轮执行后就会迅速放大。
这正是谷歌三款新模型试图占据的位置。
3.6 Flash负责复杂任务和整体协调,3.5 Flash-Lite承接高频子任务,3.5 Flash Cyber则进入专业安全场景,它们共同组成的并非一款“全能模型”,而是一套可以按照任务难度、延迟和预算进行调度的模型组合。
![]()
不过,“Lite”也不意味着绝对更便宜。
Artificial Analysis指出,与上一代3.1 Flash-Lite相比,3.5 Flash-Lite虽然平均任务耗时接近减半,智能指数提升了11分,但其每百万输出Token价格由1.5美元升至2.5美元。
在该机构的测试中,其平均单次任务成本由0.04美元增至0.09美元。
企业最终需要计算的,因而不只是API价目表,还包括完成率、返工次数、Token用量和任务耗时。一个单价更高、却能减少执行循环的模型,实际总成本可能反而更低;一个速度很快但需要反复纠错的模型,也可能失去价格优势。
模型竞争正在从参数和分数,进入更具体的单位经济账。
03 Pro还在路上
三款Flash模型密集登场,并没有完全转移外界对Gemini 3.5 Pro的关注。
在今年5月的Google I/O大会上,谷歌CEO桑达尔·皮查伊曾表示,Gemini 3.5 Pro预计于6月推出。但截至此次发布,谷歌仍只表示该模型正在与合作伙伴测试,将在“准备就绪后”扩大开放,没有给出新的时间表。
据路透社报道,Gemini 3.5 Pro延期与模型未能达到部分内部目标有关,编程能力尤其受到关注。这一具体原因尚未得到谷歌公开确认。
谷歌也在官方文章中透露,Gemini 4已经启动预训练。
于是,谷歌当前的模型路线出现了一种少见的并行状态,3.5 Pro仍在测试,3.6 Flash已经进入市场,下一代Gemini 4也开始训练。
从产品策略看,谷歌正在降低对单一旗舰模型的依赖。
相比只用一款最强模型争夺排行榜,谷歌更希望依靠Gemini API、Google Cloud、Gemini应用及CodeMender等产品,把不同模型塞进开发、办公、安全和数据处理流程。只要调用规模足够大,即使单次价格不高,也能形成稳定的云服务收入和开发者黏性。
但旗舰模型仍然重要。它不仅代表技术上限,也影响开发者、企业客户和资本市场对谷歌能否继续紧跟前沿竞争的判断。
三款Flash模型回答了如何让AI跑得更快、成本更低,却没有回答谷歌下一款旗舰模型究竟能有多强。
在Gemini 3.5 Pro正式登场前,这仍是谷歌模型版图中最显眼的空位。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.