网易首页 > 网易号 > 正文 申请入驻

横评Opus 4.8、GPT-5.5、DeepSeek V4、MiniMax M3,356元测出来的真实排名

0
分享至

大家好,我是冷逸。

最近,模型圈的节奏又加快了。Opus 4.8、GPT-5.5、Qwen3.7-Plus、MiniMax M3,四款重量级模型几乎同时登场,想认真跟一遍都很难。

昨天,我注意到一个榜单叫「Browse Code」,专门测LLM在真实浏览器环境里完成编程和网页自动化任务的成功率。


没想到,MiniMax M3在这个榜上从M2.7时期的倒数第二直接冲到了全球第五,和Claude 4.6 Sonnet、Gemini 3.5 Flash并排。

当然,一个榜单说明不了全部问题。所以我花了356元,把Claude Opus 4.8、GPT-5.5、DeepSeek-V4-ProMiniMax M3这四个模型拉到一起,用同一套任务、同一条提示词、同一个评分标准,全部接API走Claude Code/Codex测了一遍。

覆盖了3D编程、视觉编程、游戏开发、Agent长程任务四大场景,横评结果如下。


一手横评

本次测评的原则是:变量归一,对比才有意义。

四个模型用同一份视觉素材、同一条提示词,分别接各家API在Claude Code / Codex里跑,最终从任务完成度和输出质量两个维度来评价,场景覆盖3D编程、视觉编程(网站开发)、游戏开发和Agent长程任务(Office三件套 + Coding)。

1)3D任务

先给模型看一张金门大桥的实景照片,然后让它根据桥体外观,用Three.js写一个3D交互网页。


这个任务的考验是三维的:第一,模型要有视觉理解能力,能从图片里提取出关键的结构特征;第二,要能把这些特征准确映射到三维空间的几何关系上;第三,Three.js代码质量要过关,别写出跑起来就崩的东西。

三项能力任缺一项,结果都会差很多。

提示词:
参考“金门大桥.jpeg”的外观构造,帮我开发一个旧金山的金门大桥的3D交互网页,要求如下:
- 使用 Three.js,全部用程序化几何体生成,不加载外部3D模型。
- 桥体主色为国际橙色(),塔柱为Art Deco风格,桥体结构高度还原“金门大桥.png”的倒弧形外观结构。
- 准确还原金门大桥标志性的国际橙色桥塔、双塔悬索结构,包含主缆、吊索、桥面和车道分隔线。
- 环境包括:深蓝色波浪海水、天空渐变雾效,远处绿色山丘和城市群。
- 动态:海水浮动、云影移动、支持鼠标拖拽旋转/缩放。
- 性能:全屏自适应,使用Three.jsr128,输出一个可直接运行的HTML文件。
- 支持鼠标拖拽旋转、缩放、平移,初始视角从西南方向俯瞰大桥。

Claude Opus 4.8:


GPT-5.5:


DeepSeek-V4-Pro:


MiniMax M3:


这个Case里,毋庸置疑表现最好的是Claude Opus 4.8,MiniMax M3紧随其后。

这两个模型都准确还原了金门大桥最标志性的一个物理细节:主缆从两侧塔顶向跨中垂下来的倒弧形外观。这说明它们不只是在描述一座桥,而是真正理解了悬索桥的结构原理,并能把这个理解翻译成三维几何。

GPT-5.5和DeepSeek-V4-Pro则没有还原出这个特征,输出的桥体五花八门。

尤其是GPT-5.5,它的编程审美怎么描述呢,有种浓眉大眼的感觉,就很粗糙。后面几个Case,它的这个特征会一直持续。Claude和M3的视觉语言则完全相反,一看就很精致、高级,有明确的设计意识。

另外值得一提的是,DeepSeek的海洋流体动效设计得挺有意思,但天空出现了穿模问题,说明三维空间的碰撞逻辑还是处理得不够扎实。


这轮实测:Claude Opus 4.8 > MiniMax M3 > GPT-5.5 > DeepSeek-V4-Pro。

2)视觉编程(网站开发)

前几天给大家分享了“冷同学的院子”这个民宿概念,这次顺手让模型给它开发一个官网。

我的提示词故意没有给出具体的设计指令,只丢了民宿信息和素材包,让模型自己做判断——哪些素材该用、怎么排版、用什么设计语言。

这其实是在测两件事:一是视觉理解能力,模型能不能“看懂”图片、视频素材的内容和质量;二是设计决策能力,能不能根据品牌调性做出合理的创作取舍。

提示词:
给这家民宿设计一个官方网站。

民宿的基本信息:
- 民宿名称:冷同学的院子
- Slogan:云朵上的院子,冷同学的家
- 地理位置:四川汶川(羌族文化核心区、高山峡谷地带)
- 品牌调性关键词:温暖治愈 · 在地羌韵 · 自然松弛 · 外冷内热 · 有故事感
- 目标客群:追求慢生活的年轻人、亲子家庭、文化旅行者、成都周末度假客、川西旅游爱好者

文件夹【民宿资料包】放着很多民宿的素材,有logo、门店、房间、周边和宣传视频,你自己决定用哪些素材(不是所有素材都用上)。我只需要最终交付的网站顶级审美,让人看了就想马上去玩。

Claude Opus 4.8:

(可上下滑动,查看全图)

GPT-5.5:

(可上下滑动,查看全图)

DeepSeek-V4-Pro:

(可上下滑动,查看全图)

MiniMax M3:

这轮表现最好的是MiniMax M3。它确实“看懂”了我的素材和需求,一上来先给我梳理了开发计划。


然后定义出设计语言:大面积米白留白加克制几何为"冷",羌红/赭金/暖木色为"热",再把这两套视觉语言融在一起,做成"外冷内热"的调性表达。审美参考了了Aman侘寂、松赞在地文化和虹夕诺雅的克制感。


这就是视觉理解能力和设计品位带来的差距。只靠读文字提示词,是做不到这个程度的。

房型展示那一屏,M3用了左右交错的错位布局来呈现房型和价格,节奏感很好,看完真的有预订的冲动。


Opus 4.8也不赖,几处书法字体的运用尤其喜欢,素材选用也很克制,没有全部堆进去。


GPT-5.5继续它“浓眉大眼”的直男审美:大标题、方方正正的排版,完全没有灵活性,是真的很丑。

DeepSeek-V4-Pro的审美比GPT-5.5耐看一点,但它缺乏视觉理解能力,所以根本不知道哪些图该用、用在哪里,索性把所有素材全堆进去,结果图文错乱,部分页面文不对题。这是能力上的硬限制,不是调整提示词能解决的问题。

这轮测试:MiniMax M3 > Claude Opus 4.8 > GPT-5.5 > DeepSeek-V4-Pro。

3)游戏开发

不知道大家在手机上玩过“抓大鹅”没?你可能没玩过,但你的另一半一定玩过。

这次我先跟AI沟通设计了一份PRD,再让模型根据PRD开发一款web端的抓大鹅游戏。

(可上下滑动,查看全图)

这个任务的考验点在于:模型能不能完整、准确地读懂设计文档里的功能描述,并把每一条需求准确地转化成可运行的代码,同时把游戏体验和视觉完成度都顾到。

提示词:
请按PRD“大鹅.png”的要求,帮我创建一个网页版《抓大鹅》3D堆叠消除游戏。要求:
1、6种不同颜色/形状的物品,共36个,随机堆叠在3D空间中。
2、鼠标点击物品后消失,图标进入底部7格暂存栏。
3、暂存栏出现3个相同物品时自动消除。
4、暂存栏满7个不同物品时失败,场上物品清空时胜利。
5、提供洗牌、移除、回退三个道具按钮,各3次使用次数。
6、支持鼠标拖拽旋转视角和滚轮缩放。
7、支持localStorage保存进度和复活功能。
8、输出一个完整的html文件,可直接在浏览器运行。

Claude Opus 4.8:


GPT-5.5:


DeepSeek-V4-Pro:


MiniMax M3:


四个模型都把游戏开发出来了,核心功能都对,说明面对有明确PRD的开发任务,主流模型基本都能过关了。

有意义的差异集中在两点:一是前端审美,Claude依旧最耐看,DeepSeek和M3也还行,GPT-5.5最丑;二是细节完成度,PRD里有一项要求是“通关后奖励一只大鹅”,只有M3做到了,其他三个模型都漏掉了这个细节。

这轮测试:Claude Opus 4.8 ≈ MiniMax M3 > DeepSeek-V4-Pro > GPT-5.5。

4)Agent长程任务

最后一个Case也是最复杂的:我们让各个模型用Claude Code / Codex做一个联网搜索 + word/PDF生成 + skill调用 + 网站开发的复杂长程任务。

提示词:
联网搜索电影《火遮眼》的关键信息内容,尽量从权威信源获取内容。先给我创建一份2000字的word调研报告(含pdf版)。然后调用guizang-ppt skill生成一份12页的PPT,宣传一下这部电影。

Claude Opus 4.8:

(可上下滑动,查看全图)


GPT-5.5:



DeepSeek-V4-Pro:



MiniMax M3:



这个任务的难点在于“长”——不只是单步执行,而是要求模型在跨越多个工具调用节点的情况下,始终保持上下文连贯、指令不漂移。这对模型的长程稳定性和工具协调能力要求很高。

先说PPT的完成度:GPT-5.5、Opus 4.8和M3都交付了质量不错的PPT,Claude每页带微动画,GPT-5.5有真实配图(应该是Codex的原因),M3的色彩搭配比较好看。DeepSeek-V4-Pro在这一项差了明显一截,排版、配色和交互都不在同一个水平线上。

调研报告的内容质量:Opus 4.8、M3和GPT-5.5不相上下,DeepSeek-V4-Pro垫底。

关于DeepSeek-V4-Pro有一个独立的问题值得单说:它在Claude Code里跑得极慢,而且频繁中途停摆不再继续输出。这个PPT任务它跑了整整36分钟,期间多次卡顿。


大概率是DeepSeek并未针对Claude Code做更多适配导致的,属于工程层面的问题,而不只是模型能力本身的问题。但从用户体验角度来说,这个差异是实实在在存在的。

这轮测试:GPT-5.5 ≈ Claude Opus 4.8 ≈ MiniMax M3 > DeepSeek-V4-Pro。


实测总结

四轮任务跑下来,先看综合能力,再看成本。


能力上,Claude Opus 4.8是这次横评里综合实力最强的,稳如预期。

M3是最大的惊喜,整体水平大约在Opus 4.7和4.8之间,与Opus 4.8的差距比我预想的要小。

GPT-5.5表现不稳定,有时候在线,有时候掉链子,前端审美上的短板在编程场景里是一个贯穿始终的减分项。

DeepSeek-V4-Pro整体能力不如其他三家,Agent长程任务的稳定性和代码生成质量都有差距。

成本这块,本期测评费用明细:


  • Claude Opus 4.8,接API测的,50美刀;

  • GPT-5.5,在Codex里用的,大约2美刀;

  • MiniMax M3,我订的Token Plan极速版,每月有12亿额度的M3 Token,这期用了约2000万token,折下来大约2 块钱;

  • DeepSeek-V4-Pro,大量输入命中缓存,不到2元。

换算下来总计356元,而两款国产模型加起来不到总费用的零头。性价比这件事,真的越来越不好意思讨论了。


模型到底行不行,很多时候只有真实用过才知道,benchmark数字只是参考,不是结论。

至少从这几轮Coding任务来看,Claude Opus 4.8的前沿地位还是稳的。MiniMax M3也不差,大概是Opus 4.7的水准,很接近Opus 4.8了。

GPT-5.5可能在办公类任务上更有优势,但Coding层面的审美问题不是小问题,对于编程场景来说是一个明显的硬伤,而且这个问题不是靠调提示词就能解决的。

DeepSeek-V4-Pro性价比依然很高,但这次测评也暴露了它在Agent适配、长程稳定性代码生成质量上与另外三家的真实差距。差距不是追不上,但需要时间。

说实话,这轮测下来最让我兴奋的是前几天发布的M3。我没想到它能这么接近Opus 4.8。1M上下文+原生多模态+Coding SOTA,配合Token Plan的定价,真的能做很多事情。

我是冷逸,你们的测评手替。如果你有想测的场景,欢迎在评论区甩出来,咱们互相抄作业。

如果觉得本期内容有用的话,欢迎三连支持,感谢。

我们下期见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑丽文:我做不到100%团结国民党,但有100%的把握胜选2028大选!

郑丽文:我做不到100%团结国民党,但有100%的把握胜选2028大选!

天气观察站
2026-09-18 12:09:51
前NBA球员迈克尔-斯维特尼去世,享年43岁

前NBA球员迈克尔-斯维特尼去世,享年43岁

陈意小可爱
2026-09-18 09:29:56
5年1.575亿!正式签约!NBA又一份大合同

5年1.575亿!正式签约!NBA又一份大合同

篮球教学论坛
2026-09-19 02:11:10
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

另子维爱读史
2026-09-17 20:41:04
大学生掏鸟就被判十年,南京博物院前馆长徐湖平才判3年!

大学生掏鸟就被判十年,南京博物院前馆长徐湖平才判3年!

廖保平
2026-09-18 17:32:48
特朗普要大开杀戒了:摆不平中俄伊,就将目标对准美国盟友?

特朗普要大开杀戒了:摆不平中俄伊,就将目标对准美国盟友?

铁锤侃侃而谈
2026-09-18 00:11:26
霍英东宴请广东省委书记,特地备下两桌龙虾,不料对方竟带来了一百多人

霍英东宴请广东省委书记,特地备下两桌龙虾,不料对方竟带来了一百多人

人生录
2026-09-18 17:24:43
HOA又来了!屋主欠费不到1000美元,47.5万美元的房子竟被8172美元拍走!

HOA又来了!屋主欠费不到1000美元,47.5万美元的房子竟被8172美元拍走!

华人生活网
2026-09-17 04:49:19
万科A涨停,房地产股大爆发

万科A涨停,房地产股大爆发

21世纪经济报道
2026-09-18 14:45:19
威廉终于反击了!彻底拉黑亲弟弟,哈里梅根这次回国肠子都悔青了

威廉终于反击了!彻底拉黑亲弟弟,哈里梅根这次回国肠子都悔青了

白露文娱志
2026-09-18 15:48:59
当一个社会不讲事实,只看立场

当一个社会不讲事实,只看立场

作家加野
2026-09-18 11:19:01
国乒最新战报!王艺迪3连胜,男双单局被轰11-0,姚睿轩险爆冷大藤沙月!

国乒最新战报!王艺迪3连胜,男双单局被轰11-0,姚睿轩险爆冷大藤沙月!

刘姚尧的文字城堡
2026-09-18 17:27:57
太离谱了!张雪在机场吃面愤怒离场,表示筷子要收客人2块钱,真的不合理

太离谱了!张雪在机场吃面愤怒离场,表示筷子要收客人2块钱,真的不合理

火山詩话
2026-09-18 13:00:13
中国男篮20分之差惨败日本 媒体人:人家4混血+1归化+1韩裔+1华裔

中国男篮20分之差惨败日本 媒体人:人家4混血+1归化+1韩裔+1华裔

劲爆体坛
2026-09-18 20:27:04
中央决定,闫国春履新职

中央决定,闫国春履新职

新京报
2026-09-18 13:32:28
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
如果说整容有鼻祖,那成龙大哥算一位吧?

如果说整容有鼻祖,那成龙大哥算一位吧?

木子爱娱乐大号
2026-09-18 15:35:19
1-4!前欧冠冠军4连败,夏窗卖主力赚9000万,创62年最差开局纪录

1-4!前欧冠冠军4连败,夏窗卖主力赚9000万,创62年最差开局纪录

球场没跑道
2026-09-18 09:15:23
宁可嫁破产老头,也不与黎明白头到老,45岁现状唏嘘的她后悔吗?

宁可嫁破产老头,也不与黎明白头到老,45岁现状唏嘘的她后悔吗?

吃青菜长高
2026-09-18 11:25:56
国乒最新战报!世界冠军被轰3-0,王艺迪三线冲冠,单打2胜5负!

国乒最新战报!世界冠军被轰3-0,王艺迪三线冲冠,单打2胜5负!

刘姚尧的文字城堡
2026-09-18 20:17:34
2026-09-19 02:55:00
沃垠AI incentive-icons
沃垠AI
努力分享一些有用、有趣的AI干货
156文章数 63关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

数码
房产
亲子
本地
艺术

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

房产要闻

海口房价,降不动了!

亲子要闻

带中俄混血宝宝来广州,战斗娃魔丸属性突然觉醒,丽安差点招架不住!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

好色也分段位?这位时尚摄影大师,直接杀进王者局!

无障碍浏览 进入关怀版