大家好,我是程序员鱼皮。
前几天 Anthropic 发布了 Claude Opus 5,我第一时间写了一篇小短文,说 Claude Opus 5 宣称 只用一半的价格,能力追平 Claude Fable 5 旗舰模型。
这个模型的跑分还是很能打的,比如 Frontier-Bench 这个测试,考察模型能不能在命令行里独立做完一整套编程任务。
Opus 5 拿了 43.3%,上一代 Opus 4.8 只有 18.7%,顶配的 Fable 5 是 33.7%,而 OpenAI 的 GPT-5.6 Sol 是 37.5%,可以说是遥遥领先了。
![]()
但是不能完全相信跑分,模型好不好用,还得拿真实项目来检验。
之前我写过一篇 ,为了便于跟 Kimi K3 等模型对比,接下来我会用跟之前一模一样的提示词,通过 7 个不同类型的项目 来测试 Opus 5 的实际编程能力。
测试方法很简单,我在 Cursor 里同时开了多个子 Agent,每个 Agent 一个独立的项目目录、一个独立的端口,全程不需要人工干预。等过段时间我回来一个一个验收就好。
![]()
激动的心,颤抖的手,点个收藏,咱们开始~
项目实战测评
这次我准备了 7 个项目 来测试 Opus 5 的编程能力,从简单的前端动画、到复杂的全栈产品、甚至是企业级工程项目,由浅入深。
交互式动画讲解网站
3D 版动画知识讲解
文案拆解为网页 PPT
网页 PPT 生成工具(内置 AI 大模型)
足球对战网页游戏(横评对比)
以撒的结合肉鸽游戏
全栈 AI 编程工具(复刻 Cursor)
大家可以猜猜看,跑完这些任务要花多少钱呢?
答案在结尾揭晓~
1、交互式动画讲解网站
第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。
提示词里我要求它先用 Firecrawl 联网搜索技术细节,做完之后自己打开截图验证效果,不满意就自主调整,改到满意再交付。
![]()
来看成品,界面科技感满满,背景还有漂浮的光点特效。
而且整个网站很清晰、很结构化,用户可以像阅读教程一样连贯地学会这个知识,也可以通过左侧的章节导航快速跳转、查漏补缺。
![]()
第一部分它用「一张越写越花的便利贴」来引出问题,这个比喻很生动。你可以拖动滑块来增加堆叠的层数,能亲眼看到第 1 句话在最终画面里的份量越来越少,最后基本读不清了。
![]()
不过页面上存在一些瑕疵,比如出现了文字被遮挡的情况,这点比 Kimi K3 的前端效果差了一些。
![]()
不过大多数的动画效果和元素位置都是准确的,个人感觉比 Opus 4.8 做动画网站的体验好太多了!
![]()
甚至给出了几道题目来检测学习效果,选错了还会告诉你为什么错,真是太贴心了,可以给到顶级。
![]()
2、3D 版动画知识讲解
还是同一个知识点,这次换成 3D 场景来呈现。
提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。
![]()
来看成品,我刚打开页面就被惊艳到了,我 chovy!
科技感爆棚,而且动画非常流畅生动。
![]()
可以自由切换视角、放大缩小,还能并排对比多种不同的残差模式。
![]()
从事教育行业的工作者有福了,可以让 AI 把枯燥的知识点通过动画栩栩如生地展示清楚,让学生更快理解。
单从前端的角度,我真的挑不出缺点,给到夯!
3、文案拆解为网页 PPT
我做视频教程的时候,偶尔需要把文章内容做成演示画面,但手动做 PPT 太慢了。
这次我干脆把一篇技术文章丢给它,让它按照文章的讲解顺序,拆成一个能全屏演示的网页 PPT,后续可以当做视频录制的画面素材。
![]()
先看封面,完犊子了,这大标题…… 现在怎么 Claude 也一股子 GPT 味儿了。。。
![]()
整个 PPT 的效果跟其他模型差不多,毕竟我没给 AI 提供图片等素材,无非就那么几种布局。
![]()
整个 PPT 的科技感还是很足的,我觉得对于很多场合下的 PPT 讲演都是够用的。比如做毕业设计的同学,直接把自己的项目甩给 AI,毕设答辩 PPT 就搞定了,真爽死了……
![]()
从整体前端风格来看,给到顶级。
4、网页 PPT 生成工具(内置 AI)
前面 3 个都是开胃小菜,接下来该测测它的全栈工程能力了。
上一个案例是给定一篇文章生成 PPT,那能不能把这个能力做成一个通用工具呢?
用户粘贴任意文案,后端调用大模型拆解内容,前端渲染成可演示的网页 PPT,还要支持切换配色主题和导出成独立的 HTML 文件。
明确需求后,提示词就很简单了,由于涉及到 AI 能力,这里我用新出的 Kimi K3 模型作为给后端调用的模型(注意,项目本身的代码还是 Opus 5 生成的)。
![]()
来看看成品,之前用 Kimi K3 生成 PPT 工具的时候,成品非常精简,主页基本上就只有文案输入框和按钮。
![]()
但 Claude Opus 5 做的更像一个成熟的工具产品,你看左下角那一排配色主题就知道了,极光、象牙、暮色、青薄,这名字起的还挺文艺。而且每个主题下面还配了一句定位说明,细节做得非常好。
而且还可以填写生成 PPT 的额外要求。注意,我并没有在提示词中讲到这点,AI 自己帮忙锦上添花了。
![]()
随便拿我之前的一篇文章来制作 PPT,可以实时看到生成进度,直接查看效果,质量很高。
![]()
说真的,现在这种全栈项目一把梭对于 AI 已经完全没有难度了。
来切换个主题试试,效果不错吧,还能直接全屏演示或者导出为 HTML:
![]()
整体来说,无论是前端细节、还是后端生成逻辑做的都很好,一段提示词直接梭哈一个商业产品出来了,给到夯。
5、足球对战网页游戏
经常看我文章的朋友应该知道,这个项目是老熟人了。
之前 GPT-5.6 发布的时候,我写过一篇 ,用同一段提示词让 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 三个模型同时开发了一个叫「2066 决战世界杯」的足球游戏。这次的提示词跟那时候完全一致,正好拿来做个对比。
先看赛前设置界面,做得还不错。浅绿主题色跟足球场是匹配的,相得益彰。
![]()
踢球、换人功能都是正常的,非常流畅。
而且注意到细节了没?9 号球员下方有个红色的蓄力槽,给了玩家更多的操作空间。
![]()
游戏的人机也非常智能,不像其他模型开发出来的人机只会防守,这次的人机甚至还能踢出配合。而且作为玩家,也不是完全没有机会赢过人机,游戏体验非常好。
对比一下之前几个模型的表现。GPT-5.6 Sol 开发的那版,人机不会主动进攻,我打满一整场中等难度,只能以 0 比 0 收场。
![]()
Grok 4.5 模型开发的那版,球场渲染有硬伤,换人逻辑也很不顺畅,经常切换到离球最远的那个队友身上。
![]()
Claude Fable 5 开发的那版,球的物理引擎翻车了,球经常会瞬移,根本没法正常玩耍。
![]()
而 Opus 5 不仅在人机智能上突破了,左侧还会实时展示赛况,这也是之前的模型都没有做到的。
![]()
美中不足的是,足球场的白线是不是有点儿问题?禁区前面那道罚球弧两端拐进了禁区里面。综合来看给到顶级。
6、以撒的结合肉鸽游戏
接下来是一个更有挑战性的游戏项目。
以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,包括随机地牢生成、射击战斗、道具系统、多种敌人和 Boss。
之前我让 Kimi K3 开发了这个游戏,提示词中要求先用 Firecrawl 搜索以撒的结合的游戏机制和美术风格资料,用 Context7 查询所用游戏框架的文档:
![]()
当时 K3 开发出的效果是这样的,虽然界面看起来简陋,但基本玩法是完全跑通的,可以发射子弹打击怪物:
![]()
再来看看这次 Opus 5 用同样的提示词开发出的成品,前方高能!
打开网页,光是看到这个游戏主页,我的 DNA 就动了!有没有玩过这个游戏的同学,这个形象跟原版还是很接近的吧?
![]()
![]()
原版游戏形象
之前我用 Kimi K3 做这个游戏的时候,整个游戏的玩法链路已经跑通了,我当时都已经觉得很满足了。。。
![]()
结果没想到 Claude Opus 5 的效果这么好!很多小怪都是原版游戏中存在的。
![]()
而且角色的数值清晰、道具丰富多样,可以说是还原了《以撒的结合》游戏的精髓。
我甚至都玩进去了,导致这篇文章发布时间晚了 20 分钟。。。
![]()
BOSS 的机制也跟原版《以撒的结合》游戏中的 BOSS 神似!
![]()
大家觉得怎么样?
说真的,完全超出我的预期了,给到夯爆了!以后我也有戏做一些游戏了,skr~
7、全栈 AI 编程工具
最后一个项目,直接把难度拉满!
我让 AI 基于 VS Code 的开源代码,开发一个类似 Cursor 的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间可以自由切换。
看看成品,几乎完整地保留了 VSCode 的精髓,比如代码高亮、代码小地图、管理面板、代码搜索等等。
![]()
来让 AI 执行个任务试试,你能清晰地看到 AI 的思考信息、工具调用等等。
![]()
AI 甚至能够调用终端、自主测试开发出的代码,还能清晰地看到本次改动的文件!
![]()
怎么样,你敢相信我只跟 AI 对话一次,就开发出了自己的 Cursor 么?简历上又多了蓬荜生辉的一笔。
我的评价是夯爆了!
我的感受
7 个项目全部跑完了,让我印象最深刻的一点是,Claude 没有完全机械地、用最简单直接不绕弯子的方式完成任务,你让它做什么它就只做什么,而是会在你提示词需求的基础上加一点自己的想法,尽量达到理想的效果。
它不仅后端逻辑强、前端视觉效果也强,还非常注重细节,真的是六边形战士了。
至少对我来说,我暂时想不到什么开发任务 AI 完不成了。
如果有,那就是我没有驾驭好 AI,或者 tokens 不够。
另外一个让我印象深刻的点是,Opus 5 确实像官方说的那样,特别爱自己检查作业。Anthropic 甚至专门提醒开发者把提示词里那句「最后记得验证一遍」删掉,你越叮嘱它反而越容易检查上瘾。他们后来干脆把 Claude Code 的系统提示词删掉了 80% 以上,编程跑分一点没掉。
以后用这种级别的模型,该给你的提示词做做减法了,把精力花在明确需求和目标上就好,不用事无巨细地规定每一步该怎么做。
![]()
当然,这个特性是一把双刃剑,Opus 5 很容易把简单的任务搞复杂,这是 Claude 一贯的通病,也就更废 tokens。
如果你想更好地利用 Opus 5 这种级别的模型,还是要在提示词上多下下功夫,不是说要写的又臭又长,而是把需求描述清楚、限制好 AI 的边界,否则它搞不好就浪飞边子了。
最后,揭晓谜底,这 7 个任务打包加起来,一共花了我 900 多块。
这就是效果好相应的代价,之前我用 Kimi K3 等国产模型做同样的项目,加起来套餐额度才动了百分之几。
所以还是要根据你的实际需求来选择模型。
如果是追求 90 分效果的任务,可以交给 Opus 5
只需要 80 分的任务,可以交给 GPT 或者 Kimi K3 / GLM 5 这类模型,快、稳、便宜
如果任务只要及格就好,那就用性价比极高的 DeepSeek 吧
OK 就分享到这里,本文会收录到我免费开源的 ,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。
开源指路:https://github.com/liyupi/ai-guide
我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
也欢迎在评论区聊聊:你觉得这钱花得值么?你现在主力用的是哪个模型?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.