随手先关注,不错过每日AI热讯速递
①
9 月 21 日,xAI 发布新一代旗舰模型Grok 4.7,把它定位为面向编码与知识工作的最强模型[1]。
xAI 把卖点写成一句话:「Twice as fast, at half the price of comparable models.」——速度是同类模型的两倍,价格只有它们的一半[1]。
![]()
图来源:xAI 官方公告[1]
Grok 4.7的定价是输入 2 美元、输出 6 美元每百万 token,与上一代Grok 4.6完全持平[1]。
对比看位置更清楚:GPT-5.6 Sol Max是 4 美元与 20 美元,Fable 5.1 Max是 10 美元与 50 美元[1][2]。
这个价位更接近中国模型的区间,而不是西方前沿模型的区间[1][2]。
②
Grok 4.7换了比 Grok 4.6 更大的基座模型,强化学习(让模型靠试错与反馈反复调整自身行为)训练得更久、任务更难[1]。
xAI 说,训练重心压在需要数小时才能完成的长程问题上,自校验与长上下文管理同步加强[1]。
Grok 4.7 uses a new, larger base model compared to Grok 4.6.
——Grok 4.7 换用了比 Grok 4.6 更大的基座模型[1]。
Terminal-Bench 4.0上,Grok 4.7 从 Grok 4.6 的20.3%升到38.0%[1]。
Harvey Legal Agent Benchmark上它拿到19.6%,同表里 GPT-5.6 Sol Max 只有2.5%、Fable 5.1 Max 为6.7%[1]。
CursorBench 4.0上它拿到46.3%,高于 40.4% 与 41.7% 两个对照值,仍低于 Fable 5.1 Max 的51.8%[1]。
③
Grok 4.7在 Artificial Analysis 的智能指数(把十项基准的分数合成一个总分,用于横向比较不同模型)v4.3.2 上得46 分,处于中游[2]。
![]()
图:Artificial Analysis 智能指数分布图,Grok 4.7 以黑色柱高亮,纵向为指数分值,同图列出 Claude Opus 5 Max、GPT-6 max、Kimi K3 max 等对照模型(来源:The Decoder 报道页配图[2])
同一个榜上,Claude Fable 5.1 与 GPT-6各得53 分[2]。
落差在编码智能体场景里最明显:Grok 4.7 只有 26%GPT-6 Astra 为 60%、Claude Fable 5.1 为 55%,更便宜的DeepSeek V4.1 Flash27%越过它[2]。
On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent.
——在 Terminal-Bench 4.0 的独立复测里,Grok 4.7 只有 26%[2]。
发布当天Grok 4.7就能通过Grok APICursorGrok Build调用[2]。NVIDIA官方账号当天也公开发帖致贺。
④
这一代的取舍很清楚:定价对齐自家上一代、压到同级海外旗舰之下,能力重心放在长程任务与法律、办公类专业场景[1][2]。
它能否兑现这个取向,取决于独立复测的分数往后怎么走[1][2]。
如果你在用 Grok 4.7 跑长任务,欢迎把实测体验写在评论区。
参考来源:
[1] Introducing Grok 4.7https://x.ai/news/grok-4-7
[2] xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6https://the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reveal-a-wide-gap-to-claude-and-gpt-6
欢迎点赞、分享、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.