网易首页 > 网易号 > 正文 申请入驻

刚刚,谷歌Gemini 4 Argon杀回前三!追平GPT-6 Astra,Token价只要1/5

0
分享至


新智元报道


谷歌沉寂7个月,终于掏出了大的。

北京时间10月1日凌晨,Google DeepMind发布Gemini 4 Argon。这是其 7 个月来首款非 Flash 级专有模型。


Artificial Analysis的智能指数上,它拿到53分,追平GPT-6 Astra和Fable 5.1,比GPT-6.1 Sol高1分,幻觉率降至 15%。



模型在 AutomationBench-AA 和 Terminal Bench 上 Agent 能力大幅提升,同时在 CWE-bench 网络安全基准并列第一,可自主发现、验证漏洞并生成 PoC。


目前已向选定用户 rollout,支持 1M 上下文和多模态输入,直接冲击前沿模型价格战格局。

同一套评测里,按首发折扣计算,完成一个任务平均花1.99美元,为 GPT-6 Astra 的 60%。


分数追平,账单变薄。光看这两项,谷歌这次足够让人重新考虑该把任务交给谁。

但我把分数、报价和用量放在一起看,最有意思的地方出现了。这款模型算得便宜,却算得很费。打折结束,同样的任务甚至会比Astra更贵。



前三回来了,账得重新算

所谓沉寂7个月,有一个明确范围。Argon是谷歌超过7个月来第一款高于Flash级别的闭源模型,期间谷歌仍有Flash产品。


这次53分,比上一款非Flash模型Gemini 3.1 Pro Preview高23分,比Gemini 3.8 Flash高12分。AA据此判断,谷歌重回智能水平最高的3家实验室之列。

智能指数可以理解为一组能力测试的综合成绩。Argon用high推理档,Astra和Sol用max档,同分说明它们在这套评测里处于相近水平,具体工作还得分开看。

对长期关注OpenAI和Anthropic的用户,这个变化很直接。选前沿模型时,谷歌又成了值得认真比较的选项。不过Argon目前只向部分用户推送,尚未公开可用。


谷歌准备怎样吸引这些用户?报价很有诚意。

Token可以粗略理解为模型读写文字时计数的小片段。当前每百万Token,Argon输入收2美元,输出收10美元。两项单价都是Opus 5.5的一半、Astra的1/5。

反复使用同一段材料,还涉及缓存。符合缓存条件的输入可以享受95%的折扣,比Gemini 3.8 Flash的90%更低,首发期间每百万缓存输入Token只收0.10美元。


看起来相当划算。可用模型的人付的是整张账单,单价只是其中一项。

Argon平均每个任务输出6.2万Token,Astra只用2.7万。如果把推理过程比作打草稿,它的草稿纸要多写1倍多。每页便宜,架不住写得长。

算到任务成本,Argon的1.99美元确实低于Astra的3.26美元、Opus 5.5的5.98美元和Fable 5.1的7.63美元。但Sol只要0.72美元,Argon约是它的2.7倍。

更影响长期选择的是,2美元和10美元属于首发5折促销,谷歌还没公布结束日期。

恢复输入4美元、输出20美元的标准价后,按同一评测口径,单任务成本会变成3.98美元,约为Astra的1.2倍。

这些美元数字还有一个共同前提,它们是智能指数测试里的平均任务成本。你让模型改代码、查材料,输入有多长、输出多少、能用上多少缓存,都会改变账单。1.99美元不能当成所有工作的统一报价。

这就很有意思了。单价只有对手的1/5,任务账单却要付六成;促销结束,还会反超。打算长期接入的人,得拿自己的任务试算,用量和折扣条件都算进去。


少说错话,也有代价

钱算清了,还得回答一个问题。53分的Argon,究竟好用在哪里?

我最在意的是它处理「不知道」的方式。

在AA-Omniscience测试里,Argon的幻觉率为15%,是智能指数45分以上模型中最低的。Astra为51%,Sol为54%。AA的解释是,Argon更愿意承认不知道,减少猜错后仍然给答案的情况。

这对用户很有吸引力。碰到不熟悉的问题,回答越流畅,核对起来越容易掉以轻心。模型肯停下来承认能力有限,至少能让人知道哪里还需要查证。

不过,少编答案,和多答对题,是两件事。

Argon在这项测试里的准确率为50%,比Astra的63%低13个百分点,甚至比Gemini 3.1 Pro Preview低5个百分点。综合分为42,接近Astra的43,与Sol相同。

你可以欣赏它的克制,同时承认它答对的问题没有Astra多。15%的幻觉率也仅属于这项测试,不能直接当成所有日常回答的错误率。

真正动手干活的Agent能力,则呈现出另一种参差。

AutomationBench-AA上,Argon以77.5%拿到第一。但Terminal Bench 4里,它得57%,虽然比Gemini 3.1 Pro Preview提高53个百分点,仍落后于Sonnet 5.5、Opus 5.5和Astra。


AA-Briefcase也有类似反差。它满足评分细则的比例达到65%,为AA测到的最高值,分析质量和呈现质量却偏低。能按要求交活,与交出一份分析透彻、表达清楚的成果,中间仍有距离。


安全领域的成绩更抓人。CWE-bench v1检查模型能否真正修好漏洞,Argon以68%并列第一。谷歌还称,它能自行发现、验证漏洞,生成PoC,也就是证明漏洞确实存在的验证示例。

修得怎样,终于可以沿着代码往下看了。

在Text Arena上,Gemini 4 Argon排名第一。




谷歌已经让它干上了机房里的活

比榜单更让我在意的,是谷歌自己的使用情况。

据谷歌透露,Argon智能体已经分析数据中心的性能数据,找到内存优化点,相关改动随后上线,释放了超过300 TiB内存。


这段过程很具体。有正在运行的系统,有性能数据,有改动,也有部署后的结果。它给模型能力提供了评测之外的证据。

这里的300 TiB说的是释放出来的内存容量,不能直接换算成省下多少电费或服务器采购费,材料没有给出这样的账。

同一份材料还提到,Argon正参与把C/C++代码迁移到Rust,涉及超过80万行内核代码,部署前要经过大量审计和测试。这里要分清,迁移仍在推进,不能把80万行都算成已经上线的成果。

视频解码器的例子则更完整。谷歌称,智能体用安全Rust替换了3.2万行SIMD代码。这类代码负责让多份数据并行处理,对运行效率很重要。

结果是,现有Rust版本快了2.7倍,视频输出保持一致。速度提高,结果还得对得上,工程工作的要求就落在这里。

Argon支持1M Token上下文,可以接收文字、图片、视频和语音,输出文本。

对于漫长任务,Gemini API新增的Long Decode Continuation允许长回复暂停,再通过后续调用接着输出,让推理最长跑到1M输出Token,避免请求超时。

这里有两个不同的长度。上下文决定它一次能容纳多少材料,输出上限决定它能把过程持续多长。分次接着输出,解决了长任务被请求超时打断的问题,至于最后做得对不对,仍要靠检查和测试。

能连续处理更长的工作,才有条件应付那些没法几句话收工的工程任务。当然,前面的用量账也会一路跟着。

OpenAI、Anthropic和谷歌的竞争,因此又有了三方较量的意味。用户既能比较分数和价格,也终于有更具体的工程成果可看。

折扣什么时候结束,榜单还能领先多久,都有变数。谷歌已经让AI参与改造自家基础设施,这件事更值得追踪。

下一次模型发布,我想多看一点这样的结果。修好了什么,省下了什么,哪些改动已经上线。53分令人兴奋,真正用起来之后留下的成果,才值得长期买单。

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

https://x.com/sundarpichai/status/2105387952478277979

编辑:Aeneas 大卫

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今日重要赛事!10月1日,央视CCTV5、CCTV5+直播节目表

今日重要赛事!10月1日,央视CCTV5、CCTV5+直播节目表

薇说体育
2026-10-01 10:32:49
外媒:王楚钦女粉丝假装残疾坐官方轮椅观赛 站起来跪地拍照+占位置

外媒:王楚钦女粉丝假装残疾坐官方轮椅观赛 站起来跪地拍照+占位置

风过乡
2026-09-30 23:26:02
国民党主席改选落幕!表面赢家是郑丽文,真正的赢家另有其人

国民党主席改选落幕!表面赢家是郑丽文,真正的赢家另有其人

呼呼历史论
2026-10-01 07:56:38
林诗栋也没想到,国乒回国仅 1 天,26 岁王楚钦竟传来另一大好消

林诗栋也没想到,国乒回国仅 1 天,26 岁王楚钦竟传来另一大好消

观史搜寻着
2026-10-01 00:15:16
央八破例改排播!《兰香如故》让路,这部20集黑马一开播就炸了

央八破例改排播!《兰香如故》让路,这部20集黑马一开播就炸了

阿废冷眼观察所
2026-10-01 00:54:34
励志!击败中国“双保险”夺金的她身高仅1米33,从小遭冷眼嘲笑

励志!击败中国“双保险”夺金的她身高仅1米33,从小遭冷眼嘲笑

体坛小二哥
2026-09-29 22:39:40
不用怀疑,小米今年55万辆的目标,不可能完成了!

不用怀疑,小米今年55万辆的目标,不可能完成了!

互联网.乱侃秀
2026-10-01 12:40:30
二封金鹰视后!宋佳离二轮大满贯只差飞天,内娱奖项史即将改写

二封金鹰视后!宋佳离二轮大满贯只差飞天,内娱奖项史即将改写

电和影
2026-09-30 23:04:06
CCTV5+直播国足VS巴勒斯坦!U23打强队不落下风,老大哥别掉链子

CCTV5+直播国足VS巴勒斯坦!U23打强队不落下风,老大哥别掉链子

刀锋体育
2026-10-01 12:18:45
广东一男子用土豆当主食,平时家常菜也照常吃,半年瘦了25斤,脂肪肝没了,血压、血糖也稳了;网友:这可能是性价比最高的减肥法

广东一男子用土豆当主食,平时家常菜也照常吃,半年瘦了25斤,脂肪肝没了,血压、血糖也稳了;网友:这可能是性价比最高的减肥法

新快报新闻
2026-09-30 23:37:03
何猷君奚梦瑶梁安琪与赌王画像同框 现场庄重温馨画面感人

何猷君奚梦瑶梁安琪与赌王画像同框 现场庄重温馨画面感人

手工制作阿歼
2026-10-01 13:15:11
赛力斯和华为合作模式再调整

赛力斯和华为合作模式再调整

第一财经资讯
2026-10-01 13:05:56
空姐下跪道歉事件反转,东航通报还原万米客舱冲突:旅客只是手肘被碰到,通报认定没伤、拒绝就医,网友:必须处罚他

空姐下跪道歉事件反转,东航通报还原万米客舱冲突:旅客只是手肘被碰到,通报认定没伤、拒绝就医,网友:必须处罚他

王老师你还好吗
2026-10-01 00:59:54
订单越多越麻烦?C919首批订单全部交付时,意想不到的事出现了

订单越多越麻烦?C919首批订单全部交付时,意想不到的事出现了

疯狂小菠萝
2026-10-01 11:25:29
杵C姐和富贵花抢大佬!

杵C姐和富贵花抢大佬!

八卦疯叔
2026-10-01 10:28:48
30天30队·火箭:乌度卡的控制欲

30天30队·火箭:乌度卡的控制欲

张佳玮写字的地方
2026-09-30 13:22:09
揭秘锡安变瘦内幕!专家全方位改善身体状态 新赛季出勤率令人期待

揭秘锡安变瘦内幕!专家全方位改善身体状态 新赛季出勤率令人期待

罗说NBA
2026-10-01 07:06:57
车主注意!11月1日起加油新规正式生效:不懂很容易吃亏被罚

车主注意!11月1日起加油新规正式生效:不懂很容易吃亏被罚

快科技
2026-09-30 16:11:41
四平溃败东北濒临崩盘,无人敢战之际,却被闲置时的陈光一战翻盘

四平溃败东北濒临崩盘,无人敢战之际,却被闲置时的陈光一战翻盘

纪史行者
2026-09-27 06:35:06
中文提示“限购2瓶”英文提示“限购3瓶”?金粒门门店:已更正

中文提示“限购2瓶”英文提示“限购3瓶”?金粒门门店:已更正

齐鲁壹点
2026-09-30 20:34:30
2026-10-01 13:47:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16320文章数 67098关注度
往期回顾 全部

科技要闻

华为Mate90系列发布,售价5999元起

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

手机
家居
艺术
本地
房产

手机要闻

139元起!华为Mate 90系列积木壳发布:可自由拼装DIY

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

吴冠中最后一回野外油画写生,2875万!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

无障碍浏览 进入关怀版