网易首页 > 网易号 > 正文 申请入驻

国产模型亮眼表现,多新模型入榜

0
分享至

IT之家 9 月 2 日消息,Arena(arena.ai)平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。

国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 1 位以内,ELO 分差均在 30 分以内,属于统计误差范围内的接近。

另外,本周有两款新模型入榜,分别是谷歌 Gemini-3-Flash 和智谱 GLM-5.3-Flash,首秀分别排在第 27 位和第 30 位,ELO 分数分别为 1474 分和 1473 分。

国产模型整体处于中上游位置:

  • 月之暗面 kimi-k3-max 排名最高,位列第 10 名,ELO 1489 分,排名持平;
  • 智谱 glm-5.3-max 位列第 17 名,ELO 1482 分,较上周下降 4 位;
  • 阿里 qwen3.8-max 位列第 20 名,ELO 1479 分,较上周下降 1 位;
  • 阿里 qwen3.7-max-preview 位列第 28 名,ELO 1474 分,排名下降 1 位;
  • 智谱 glm-5.3-flash 位列第 30 名,ELO 1473 分,为本周新入榜模型。
排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-claude-fable-5Anthropic1508 ±527013$10 / $501M2-claude-opus-4-6-highAnthropic1505 ±472114$5 / $251M3-claude-opus-4-7-highAnthropic1502 ±460125$5 / $251M4-muse-spark-1.2 (xHigh)Meta1499 ±103245$1.25 / $4.25N/A5-claude-opus-4-6Anthropic1498 ±376040$5 / $251M6-claude-opus-4-7Anthropic1494 ±461248$5 / $251M7-claude-opus-5-highAnthropic1492 ±534718$5 / $251M8-muse-spark-1.1Meta1491 ±523814$1.25 / $4.25N/A9-gemini-3.7-flash-highGoogle1491 ±85682$0.75 / $3.571.05M10-kimi-k3-maxMoonshot1489 ±517908N/AN/A— 以下为 Top 10 外的国产模型 —17↓ 4glm-5.3-maxZ.ai1482 ±77454$1.4 / $4.41.05M20↓ 1qwen3.8-maxAlibaba1479 ±613190$2 / $61M28↓ 1qwen3.7-max-previewAlibaba1474 ±103707$1.48 / $4.431M30新上榜glm-5.3-flashZ.ai1473 ±94451$0.15 / $0.51.05M代码榜

本周代码榜头部同样由 Anthropic 垄断,Claude-Opus-4-7-high 以 1552 分稳居第一,前三名 ELO 分差仅 1 分,在误差范围内视为并列。

最值得关注的是国产新模型 GLM-5.3-Flash 首次入榜即闯入 Top 10,排在第 7 名,ELO 分数达到 1535 分,超过绝大多数头部海外模型。另外 OpenAI 新模型 GPT-5.6-Terra-Xhigh 也首次入榜,排在第 30 名,ELO 1519 分。

国产模型在代码榜已有多款进入前列:

  • 月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;
  • 智谱 glm-5.3-flash 位列第 7 名,ELO 1535 分,本周新入榜;
  • 智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 6 位;
  • 阿里 qwen3.7-max-preview 位列第 18 名,ELO 1525 分,下降 1 位;
  • 小米 mimo-v2.5-pro 位列第 24 名,ELO 1521 分,上升 3 位;
  • 阿里 qwen3.8-max 位列第 29 名,ELO 1519 分,下降 4 位。
排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-claude-opus-4-7-highAnthropic1552 ±617190$5 / $251M2-claude-opus-4-6-highAnthropic1552 ±618804$5 / $251M3-claude-fable-5Anthropic1551 ±87247$10 / $501M4-claude-opus-4-7Anthropic1547 ±617347$5 / $251M5-claude-opus-4-6Anthropic1546 ±521209$5 / $251M6-kimi-k3-maxMoonshot1542 ±94674N/AN/A7新上榜glm-5.3-flashZ.ai1535 ±181213$0.15 / $0.51.05M8-claude-opus-4-8-highAnthropic1534 ±613386$5 / $251M9-muse-spark-1.2 (xHigh)Meta1534 ±20936$1.25 / $4.25N/A10↓ 3claude-opus-5-highAnthropic1533 ±79237$5 / $251M— 以下为 Top 10 外的国产模型 —16↓ 6glm-5.3-maxZ.ai1528 ±141961$1.4 / $4.41.05M18↓ 1qwen3.7-max-previewAlibaba1525 ±181119$1.48 / $4.431M24↑ 3mimo-v2.5-proXiaomi1521 ±615762$0.44 / $0.871.05M29↓ 4qwen3.8-maxAlibaba1519 ±103828$2 / $61M前端开发榜

本周前端开发榜迎来重大变化,阿里新模型 Qwen3.8-max-0902 首次入榜即直接登顶,以 1691 分夺得榜首,将此前的 Claude-Opus-5-Max 挤到第二。

腾讯新模型 Hy4-Preview 首秀排在第 8 名,ELO 1627 分;阿里 Qwen3.8-flash-next 首秀第 9 名( 1622 分),智谱 GLM-5.3-Flash 首秀第 12 名( 1604 分),四款国产新模型集体闯入前 12,表现极为抢眼。

国产模型在前端开发榜占据半壁江山,头部位置稳定:

  • 阿里 qwen3.8-max-0902 位列第 1 名,ELO 1691 分,本周新入榜;
  • 月之暗面 kimi-k3-max 位列第 3 名,ELO 1674 分,下降 1 位;
  • 阿里 qwen3.8-max 位列第 4 名,ELO 1669 分,下降 1 位;
  • 腾讯 hy4-preview 位列第 8 名,ELO 1627 分,本周新入榜;
  • 阿里 qwen3.8-flash-next 位列第 9 名,ELO 1622 分,本周新入榜;
  • 智谱 glm-5.3-flash 位列第 12 名,ELO 1604 分,本周新入榜。
排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1新上榜qwen3.8-max-0902Alibaba1691 ±191390$2 / $61M2↓ 1claude-opus-5-maxAnthropic1687 ±810517$5 / $251M3↓ 1kimi-k3-maxMoonshot1674 ±114544$3 / $151.05M4↓ 1qwen3.8-maxAlibaba1669 ±123220$2 / $61M5↓ 1claude-opus-5-highAnthropic1661 ±810462$5 / $251M6↓ 1grok-4.6-highSpaceXAI1629 ±171534$2 / $6500K7↓ 1claude-fable-5Anthropic1628 ±89131$10 / $501M8新上榜hy4-previewTencent1627 ±171438$0.83 / $2.51.05M9新上榜qwen3.8-flash-nextAlibaba1622 ±151939$0.16 / $0.471M10↓ 3gpt-5.6-sol-xhigh
(codex-harness)OpenAI1616 ±710766$4 / $201.05M— 以下为 Top 10 外的国产模型 —11↓ 3glm-5.3-maxZ.ai1609 ±132712$1.4 / $4.41.05M12新上榜glm-5.3-flashZ.ai1604 ±161749$0.15 / $0.51.05M13↓ 4qwen3.8-27bAlibaba1598 ±113312$0.4 / $3N/A15↓ 4glm-5.2-maxZ.ai1585 ±79636$1.4 / $4.41M16↓ 4deepseek-v4-pro-high-20260813DeepSeek1583 ±113349$1.32 / $3.96N/A17↓ 4deepseek-v4-flash-highDeepSeek1580 ±103998$0.44 / $1.321.05M29↓ 3seed-2.1-pro-previewBytedance1522 ±88452N/AN/A智能体榜

本周智能体榜头部格局基本稳定,Anthropic 模型依然占据前三,Claude Opus 5 (High) 以 13.74% 的净提升度蝉联第一,工具幻觉率仅 0.8%,为头部模型中最低。值得关注的是智谱 GLM 5.2 (Max) 排名大幅提升 7 位,来到第 10 名,净提升度 6.23%,任务确认成功率达到 8.65%,表现亮眼。

本周共有四款新模型入榜,分别是 SpaceXAI Grok-4.6 (xHigh)、智谱 GLM 5.3 Flash、智谱 GLM 5.3 (Max)、阿里 Qwen3.8 Flash Next 和阿里 Qwen 3.8 27B,其中 Grok-4.6 (xHigh) 首秀排在第 15 名,净提升度 5.33%。

国产模型在智能体榜已有多款进入前 20,具体排名:

  • 月之暗面 Kimi K3 (Max) 排名第 6 名,净提升度 8.71%,任务确认成功率 16.90%,较上周下降 2 位;
  • 深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14 名,净提升度 5.91%,任务确认成功率 13.14%;
  • 阿里 Qwen3.8 Max 排名第 16 名,净提升度 5.24%,工具幻觉率仅 0.11%;
  • 智谱 GLM 5.2 (Max) 排名第 10 名,净提升度 6.23%,较上周上升 7 位;
  • 智谱 GLM 5.3 Flash 排名第 19 名,净提升度 4.03%,本周新入榜;
  • 智谱 GLM 5.3 (Max) 排名第 20 名,净提升度 3.74%,本周新入榜。
排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性1-Claude Opus 5 (High)Anthropic13.74% ±1.8%14.96% ±3.73%21.82% ±6.81%16% ±3.26%2-Claude Opus 5 (Max)Anthropic11.69% ±2.01%15.49% ±4.03%18.35% ±7.36%8.3% ±3.98%3-Claude Fable 5 (High)Anthropic10.61% ±1.53%6.81% ±3.3%20.25% ±5.49%13.23% ±2.77%4↑ 1GPT 5.6 Sol (xHigh)OpenAI9.49% ±1.51%7.57% ±3.2%21.62% ±5.62%8.73% ±2.88%5↑ 1Claude Opus 4.8 (High)Anthropic9.22% ±1.53%5.38% ±3.11%18.87% ±5.3%12.06% ±2.83%6↓ 2Kimi K3 (Max)Moonshot8.71% ±0.66%16.9% ±1.35%15.85% ±2.31%2.13% ±1.29%7-GPT 5.5 (xHigh)OpenAI7.53% ±1.08%2.45% ±2.36%12.23% ±3.75%8.55% ±1.99%8↑ 3Claude Sonnet 5 (High)Anthropic7.51% ±2.11%1.07% ±4.44%12.46% ±7.28%12.29% ±4.43%9↓ 1Claude Opus 4.7 (High)Anthropic6.49% ±1.42%3.98% ±3%10.47% ±4.7%6.18% ±2.62%10↑ 7GLM 5.2 (Max)Z.ai6.23% ±0.77%8.65% ±1.66%11.26% ±2.71%5.41% ±1.41%— 以下为 Top 10 外的国产模型 —14-DeepSeek V4 Pro (High) (0813)DeepSeek5.91% ±1.04%13.14% ±2.13%5.47% ±3.51%1.06% ±2.31%16↓ 1Qwen3.8 MaxAlibaba5.24% ±1.13%8.38% ±2.5%6.47% ±3.89%4.56% ±2.26%19新上榜GLM 5.3 FlashZ.ai4.03% ±1.23%14.56% ±2.63%4.64% ±4.09%1.19% ±2.7%20新上榜GLM 5.3 (Max)Z.ai3.74% ±0.77%12.36% ±1.71%4.27% ±2.53%0.83% ±1.55%23↓ 3Deepseek V4 Flash (High)
(20260731)DeepSeek2.85% ±0.81%6.97% ±1.82%3.38% ±2.73%0.16% ±1.65%24新上榜Qwen3.8 Flash NextAlibaba2.51% ±1.57%11.86% ±3.26%1.54% ±5.29%0.31% ±3.72%27-Kimi K2.7 CodeMoonshot1.24% ±2.52%1.92% ±5.57%1.16% ±8.58%5.13% ±5.51%28新上榜Qwen 3.8 27BAlibaba1.19% ±1.11%7.08% ±2.54%0.84% ±3.67%0.27% ±2.28%AI 生图榜

本周 AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分继续领跑,国产 seedream-5.0-pro 稳居第 8 名,qwen-image-3.0-pro 排在第 9 名,两款国产模型均守住 Top 10 位置。谷歌 gemini-2.5-flash-image-preview 本周新入榜,排在第 30 名,ELO 1150 分。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-gpt-image-2 (medium)OpenAI1382 ±475014$8 / $30N/A2-mai-image-2.6-previewMicrosoft AI1331 ±86418N/AN/A3-grok-imagine-image-2.0 (low)SpaceXAI1316 ±122675N/AN/A4-reve-2.1Reve1302 ±87580N/AN/A5-muse-imageMeta1281 ±622691N/AN/A6-reve-2.0Reve1270 ±614631N/AN/A7-gemini-3.1-flash-image
(nano-banana-2) [web-search]Google1263 ±536392$0.5 / $3131.1K8-seedream-5.0-proBytedance1258 ±548174N/AN/A9-qwen-image-3.0-proAlibaba1255 ±710927N/AN/A10-mai-image-2.5Microsoft AI1254 ±456737N/AN/A— 以下为 Top 10 外的国产模型 —16-qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612013N/AN/A29-hunyuan-image-3.0Tencent1151 ±3173101N/AN/AAI 视频榜

本周 AI 视频榜迎来新榜首,谷歌 gemini-omni-1.1-flash 首次入榜即夺得第一,ELO 1515 分,超过此前的 gemini-omni-flash。

国产模型方面,dreamina-seedance-2.0-720p 排在第 4 名,dreamina-seedance-2.5-720p 排在第 5 名,minimax-h3 上升至第 6 名,MiniMax 新模型 hailuo-2.3 首次入榜排在第 30 名,ELO 1205 分。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1新上榜gemini-omni-1.1-flashGoogle1515 ±161762$1.5 / $9131.1K2↓ 1gemini-omni-flashGoogle1512 ±1019830N/AN/A3↓ 1flux-3-videoBlack Forest Labs1495 ±171287N/AN/A4↓ 1dreamina-seedance-2.0-720pBytedance1479 ±951266N/AN/A5↓ 1dreamina-seedance-2.5-720pBytedance1476 ±142121N/AN/A6-minimax-h3MiniMax1460 ±105813N/AN/A7↓ 2muse-videoMeta1457 ±152178N/AN/A8↓ 1happyhorse-1.0Alibaba-ATH1428 ±1322112N/AN/A9↓ 1sora-2-proOpenAI1365 ±748782$0 / $0.3N/A10↓ 1veo-3.1-audioGoogle1364 ±1413705$0 / $0.4N/A— 以下为 Top 10 外的国产模型 —15-wan2.7-t2vAlibaba1344 ±820882N/AN/A19↓ 1wan2.6-t2vAlibaba1329 ±847267N/AN/A20↓ 1seedance-v1.5-proBytedance1256 ±775890N/AN/A23↓ 2wan2.5-t2v-previewAlibaba1247 ±930497N/AN/A30新上榜hailuo-2.3MiniMax1205 ±679981N/AN/A

总结来看,本周 Arena 周榜最大看点是多款国产新模型集中亮相并取得优异排名,glm-5.3-flash 在代码榜闯入 Top 10,qwen3.8-max-0902 更是直接登顶前端开发榜,显示国产模型在代码开发领域持续进步。头部依然是 Anthropic 模型垄断综合和代码榜,但国产模型在细分领域已经能冲击榜首位置,后续更多国产新模型的表现值得继续关注。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
6毫米结石堵住输尿管,27岁男子手术前夜自行排石:反复跳跃、蹲起,拿筋膜枪对着右侧腰部震了近半小时,“手术可以取消了”;致肾脏破裂

6毫米结石堵住输尿管,27岁男子手术前夜自行排石:反复跳跃、蹲起,拿筋膜枪对着右侧腰部震了近半小时,“手术可以取消了”;致肾脏破裂

大风新闻
2026-09-01 12:08:07
李维康去世仅2天,私生活被扒底朝天,原来她和迟重瑞同病相怜

李维康去世仅2天,私生活被扒底朝天,原来她和迟重瑞同病相怜

月光作笺a
2026-09-02 09:02:07
为什么女朋友觉得年入百万是很简单的事?网友评论:扎心啊!

为什么女朋友觉得年入百万是很简单的事?网友评论:扎心啊!

夜深爱杂谈
2026-09-02 19:30:12
外交部:尼泊尔泥石流灾害已排查出261名失联外籍人员

外交部:尼泊尔泥石流灾害已排查出261名失联外籍人员

澎湃新闻
2026-09-02 17:21:58
马媒:7比1打败阵风不重要,歼-16飞行6000公里后立刻上阵才厉害

马媒:7比1打败阵风不重要,歼-16飞行6000公里后立刻上阵才厉害

陶慕剑地球观察
2026-09-01 18:31:54
今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

拾光纪闻
2026-09-02 05:27:55
林肯号惨成啥样?看这张图就明白了

林肯号惨成啥样?看这张图就明白了

观察者网
2026-09-02 17:56:05
三地政府主要领导调整

三地政府主要领导调整

新浪财经
2026-09-01 17:30:51
一天双重羞辱!上合被印度说教,G20被欧盟除名,俄罗斯局面难堪

一天双重羞辱!上合被印度说教,G20被欧盟除名,俄罗斯局面难堪

趣文说娱
2026-09-02 16:15:31
狼牙山五壮士幸存者葛振林,晚年坦言当年隐情:他与宋学义一同跳下,没想到一株老树竟扭转了终生际遇

狼牙山五壮士幸存者葛振林,晚年坦言当年隐情:他与宋学义一同跳下,没想到一株老树竟扭转了终生际遇

磊子讲史
2026-08-31 14:10:54
29.99万!小米新车官宣:9月7日,正式上市!

29.99万!小米新车官宣:9月7日,正式上市!

科技堡垒
2026-09-02 15:44:55
孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

江启
2026-08-31 04:00:08
4名“班主任”被抓!常州各班级注意

4名“班主任”被抓!常州各班级注意

中吴网
2026-09-02 16:27:23
世预赛亚大区官方实力榜:中国男篮升至第5 日本跌第3韩国第8

世预赛亚大区官方实力榜:中国男篮升至第5 日本跌第3韩国第8

醉卧浮生
2026-09-02 14:50:27
打到快凌晨2点、鏖战近5个小时,美网险爆大冷:头号种子3-2晋级

打到快凌晨2点、鏖战近5个小时,美网险爆大冷:头号种子3-2晋级

寒士之言本尊
2026-09-02 19:09:13
美国一军事专家曾透露出一惊人内情:"日本故意招惹中国,其实是为了达到另一个目的!他们就想激怒中国,好趁机给自己松绑扩军!"

美国一军事专家曾透露出一惊人内情:"日本故意招惹中国,其实是为了达到另一个目的!他们就想激怒中国,好趁机给自己松绑扩军!"

扶苏聊历史
2026-09-01 15:47:22
孙割被割:1.9亿刀,仅退款、小作文惹毛川普

孙割被割:1.9亿刀,仅退款、小作文惹毛川普

小小河
2026-08-31 16:27:29
原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

扶苏聊历史
2026-09-02 17:28:54
国乒教练组大洗牌!马琳升职掌权,肖战牺牲让步,王皓争议并非空穴来风

国乒教练组大洗牌!马琳升职掌权,肖战牺牲让步,王皓争议并非空穴来风

南风入弦y
2026-09-01 16:24:49
连爆大冷!世界第1第4第5第6集体一轮游,国羽男单5进2,李诗沣7-21惨败出局

连爆大冷!世界第1第4第5第6集体一轮游,国羽男单5进2,李诗沣7-21惨败出局

锐评利物浦
2026-09-02 15:19:28
2026-09-02 20:04:49
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
364456文章数 607480关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

游戏
家居
时尚
数码
手机

《FF7》蒂法惨遭DLSS5摧残!变大妈难以接受

家居要闻

2026建博会(广州) 公装联探展交流活动

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

数码要闻

179元!米家石墨烯暖风机C众筹开售 支持80°广角送风

手机要闻

拉美手机市场Q2大跌12%!三星成TOP5唯一增长品牌 传音重返第五

无障碍浏览 进入关怀版