网易首页 > 网易号 > 正文 申请入驻

实测GPT-6很强,但被吹过头了

0
分享至

凌晨一点,我给GPT-6留了句话:

“加油,我去睡觉了,剩下的事情你自己做好”。

半个小时后,我不放心又跑回来指指点点:

“网站后半部分作品介绍这里的动效太生硬了,重点优化改进,还是保持和前面一贯的动效和触发风格。文字错峰出现微动效加入。然后酌情加入粒子morph效果,可以组合使用p5.js或者其他动效库。”

这是我在使用GPT-6 Astra Ultra 2x Speed(终极满血版)的一个过程片段。


01招聘笔试题,我让AI做了一遍

前几天GPT-6正式上线,全网一阵喧嚣“夯爆了”、“天塌了”,究竟效果如何,我来试试看。

我向隔壁视频组的同事借来一份他们的剪辑笔试题,一份真实的用来招聘实习生用的剪辑测试。

素材很原始,山景、航拍、城镇、街巷都有,甚至还有街边美食和路过的小猫。但唯独所有素材都剔除了音频轨道,也没有额外提供音效和音乐。拍摄格式也很杂,大疆拍摄的D-Log M、手机拍摄的SDR、尼康相机拍摄的N-Log等等,视频长度、帧率、码率、色彩空间、白平衡也都不一致。


需求是根据这套素材包,整理剪辑成一份以「云南汤丹镇」为背景的旅游vlog视频开场混剪。

让AI来剪视频的想法由来已久,但对模型和配套Agent能力的要求很高,既要能多模态识别内容,还得有良好的审美,同时还能在复杂的专业软件里动手操作。

在Codex里给GPT-6开放了「Computer Use」(电脑使用)功能,这样能够让AI在我的电脑桌面上像人类一样点击控制各种软件。这其中就包括了DaVinci Resolve(达芬奇)这一专业视频剪辑调色软件,也为这项工作提供了可行性。

然后,它就开始工作了。


控制达芬奇有两种模式,一种是AI在可视化的界面上控制软件操作,另一种是走达芬奇自己的脚本模块。


你别说,看着AI咔咔出片段还挺有成就感的。

但AI不急着上来就剪,它先分析整体素材,基于内容创建剪辑脚本,同步创作或者下载各种音频素材,然后再转为程序化脚本把片段插入到时间线上。最后再迭代优化修改,补齐各种包装字幕,或者精细化调色和动效制作。


AI基于自己的理解给每一版都起了名。

第一版叫《山的回信》,约54秒。整体偏舒缓,山城、街巷、生活,再回到群山,片子和可编辑工程都交了出来。

作为舒缓慢节奏类型的视频,这个片子是及格的,而且令人欣喜的是整体调色质感也不错。从拿到需求到一次性成片,用了55分钟。

但这个视频节奏太慢了,对于短视频时代来说很难一开始就吸引到人的注意力。所以我让它保留这一版的基础上,单独做一个更有冲击力的版本,往动作预告和旅行vlog开场的方向走。

它对“节奏快”这个要求,执行得很积极。

修订后的第二版《山城脉冲》约42秒,里面有69个画面片段。

乱,非常乱。

上一镜的主体在左边,下一镜要看的东西去了右边,观众刚跟上一个动作,画面又切走了。每张图单独看都有内容,拼在一起,焦点始终无序乱动,对于观众的注意力引导非常不到位。

快剪得给视线留条路。一个圆形接另一个圆形,一条弯路接另一条弯路,运动方向能顺着接,观众就不用每切一刀重新找人。这也就是“相似专场”的目的。镜头切得短,和镜头接得顺,还得分开检查。


包装和声音一开始也不行,花字的辨识度不够,AI自制的音效也听起来没什么质感。后来我打开Epidemic Sound曲库网站,让AI自己在里边下载曲目和音效,后来视频的声音质感才好了一点。

但更基础的问题其实是重复。

同一条素材里相近的内容,前后又出现一次,还带着一点错位。换了几帧起点,内容依然是刚才那段,观感非常糟糕。

所以第三版就重新大改,往户外纪实和时尚旅行vlog的方向靠。我把制作顺序也说得更具体:详细分镜和声音设计先做好,再剪。音频拆成能单独处理的片段,调色要照顾不同镜头和局部。

最终第三版《风过山城》约45秒,25个镜头来自25条不同素材。画面从车里的山路走进旧楼和院落,去看花、窗台、台阶上的猫,再到球场和市场。

前一镜还在桌上看模型,后一镜已经走进真正的山里。形状接上了,内容也有关系,比凭空加一个声势浩大的转场更有理由。

声音最后拆成16条轨道、48个独立片段。市场还没入画,声音可以先到;摩托离开镜头,引擎声稍微多留一下,接下来的航拍就顺些。剪辑里常说的J-cut、L-cut,这些我在第三版修改的时候重点提了出来。

不过在快交付时,“胶片感”又做过头了。山、云和植被被染得太浓,我让它恢复一部分自然色彩。之后撤回重染色,保留细颗粒,再处理车头、亮叶、云层这些局部。片尾浅灰字叠在亮云上快看不见了,也改成了墨色。



到这一步,成片才勉强做完。

显然,以目前的方式去剪辑这个无口播引导的空镜小混剪还是有些麻烦的。

比人类剪辑师还要差很多,特别是精细化细节和小设计都明显不够。但反过来看,这三条视频混剪只用了不到6个小时的时间,假以时日或者提供足够多的剪辑要求,一些简单的剪辑工作应该也可以交给AI来搞了。

有压力了吗?朋友们。

02建模+前端,效果怎么样?

最近全网沸沸扬扬用GPT-6搭配Blender建模去做前端开发。我也来凑个热闹,用AI做一个关于M.C.埃舍尔的线上艺术展。


要求比普通介绍页多一些。虽然主角是埃舍尔,但主视觉元素是大卫头像,和埃舍尔著名的不可能楼梯。

在HTML页面上这俩要能一起动,随着滑动旋转、分片、重组,依次经过古典油画、原色构成、酸性设计和玻璃质感四种风格。整个网站后面还得有埃舍尔的作品介绍和生平,中英混排,支持离线运行。

我还在需求中特意提了一个模糊的要求“世界顶级的效果”,形容词很充足,具体能生成什么样,交给AI来试试。

第一轮交付,约46分钟。

开场确实挺像样。同一颗头像和同一组楼梯,换着材质和视觉风格往前走,头像能拆开,又能拼回来。第三幕进入荧光色和错位分片,跟前面的古典气质拉开了距离。

我中途又加了全场景拼贴,并明确所有内容都放在固定的一屏里。往下滑时,内容在画框里面切换,页面别一路长下去。它随后补进纸片、手稿和图像裁片,作品一次看一件,生平拆成分页。这里也有我追加需求的部分。

三维模型要单独说一下。光看网页上的大卫,很容易以为Blender里已经做出一尊很精细的完整雕塑。

项目里确实有一个完整体积的研究模型,五官、卷发和脖子都在。但预览里的细腻程度还有距离,最后进网页的,用了另外一套方案。


它把生成的大卫习作图像映射到有厚度的几何体上,做成五片闭合浮雕。Blender提供轮廓、起伏、侧背面和分片,精细五官、卷发与石材观感主要来自图像。网页负责实时运动、变色和玻璃风格。

这办法在有限角度下很好用,正面有细节,小幅转动和拆分重组也能成立。但真要绕到后脑勺,像看一尊完整雕塑那样看,就超出了它的适用范围。


放在这个网页里,这种取舍显然是明智的。既能节省空间、又能提高网页性能,任务完成速度也快(不需要耗费巨大精力去做精细建模)。如果下一份需求变成任意角度旋转的雕塑展示,这个模型就得重新评估了。

前面的主视觉过了,滑到后面的作品介绍,又有了新的意见。前半场头像会转、会拆、会重组,后半场却近乎直接替换图文,逛展逛到一半,忽然开始翻课件。

于是有了开头那段凌晨的反馈。

改过以后,小幅滑动能慢慢推进切换,反向滑可以撤回来。旧图短暂留着,新图和纸片带一点位移接进来,再让标题、作品信息、正文错开出现。第一轮文字还是有些急,实测后又放慢了一次。


我提了p5.js,它最终用了轻量Canvas做粒子,采样现有作品图像,在交接时短暂聚散,静止后停止绘制。对这次想要的效果,这个选择能用,也没必要为了用上某个库再加一摊东西。

也正是经过好几轮细节描述和各种前端专业术语的组合提示,最后才交付出目前的这个效果。如果只是单独一轮一次性弱提示词生成,目前这个效果是做不出来的。

当然,当前版本优化的空间还很大,比如超高分辨率下的字体大小动态适配、翻页动效的跟手程度等等。如果要做旋转式的大卫雕塑,建模还得更精细化处理。

03离不开人类介入

没错,我是来泼冷水的。

人们对于AI模型的发展有时候会陷入一种“虚空索敌”和“妄自菲薄”的状态。模型正常的版本迭代,对比的是其他模型(包括它的前代版本)。而看热闹的人们总是想把模型本身和人类自己强拉起来对比,然后舆论场铺天盖地“核弹爆炸”、“天塌了”、“xxx要完蛋了”这种语论,刷多了心好累。

反观业内深究细节的人们,大家普遍持有理性且冷静的态度。这与人们对AI模型底层原理认知程度不同有关,理解程度的差异产生了情感上的错位。

首先,GPT-6很强,这是一个各方面体验都很不错的模型:执行到位、响应速度快、生成质量可控等等。但这里指的是相对其他模型,而不是人类自己。

传说中的AGI没有来,让无数人高喊“天塌了”的现况也没有出现。

对于拥有确定性路径的工作来说,GPT\-6可以很好地执行。往小了说,整理项目、统计数据、输出文档这些重复性工作是一种,往大了看,传统前端开发、产品测试、网络攻防等这些有具体文档、流程或者协议限定的规则性工作也是一种确定性路径下的需求。主要区别在路径规模的深度和广度。


前面的两个项目里,分镜、可编辑工程、拆好的声音轨道,都实实在在交了出来,网页也做了检查和修订。这部分工序很繁琐,交给它推进,目前的质量相比前代是有提升的。

但是视频导出、网页能运行以后,作为人类,我还得对“审美”这件非常难以量化定性描述的概念做把关。

说到底,现阶段的所有LLM依然是一个在较高复杂状态下尽力寻求最优路径的概率模型,可以粗暴理解为一个带有预测和压缩性质的“词语接龙器”。这一点,在上个月的谷歌开发者大会现场得到了诸多业内大牛的印证和共识。

“最优路径”在一些简单场景下,会收敛到“最短路径”。每个模型的最短策略也不一样,受限于资源和模型大小,还有注意力分配机制等,不同策略下的贪心规模会产生不同程度的局部最短。而体感上越是所谓“聪明”的模型,贪心覆盖的范围便会越大越准,甚至在一些场景下,“局部最短”会逼近“全局最短”,但“全局最短”也不等于“全局最优”,需求和覆盖场景越是复杂,理论上的“全局最优”越难达到。


那几轮快剪,片段切短了,速度提上去了,整段看下来,视线引导一塌糊涂。接下来要改哪里,就得把要求再往细处说。

如果把AI的智力看做流水,那么「约束」本身就是一个水管。让水朝着一个指定的方向流,而不是漫灌。出于这种考虑,业内发展起来了Spec Coding,提前通过各种限定性的文档和规范,来引导AI的方向和行为。

与之相对的Vibe Coding,也有人称之为“许愿式编程”。这是一种开放条件下使用AI的方式,也是很多人第一次接触AI时的行为方式。

当然这俩不是非此即彼,是可以在不同阶段组合使用的。我在提示词里故意写下了“电影感”“世界顶级”这种模棱两可的说法,目的是试探GPT-6能够揣测到什么程度。但等片子和网页摆在面前,遗憾还是发生了。声音质感不对,作品介绍的动效也跟前半场割裂开。于是,原本没写清的试探,一点点变成了修改意见。

其实这点适用于所有模型,如果在需求足够清晰、条件足够明确、边界足够准确的情况下,AI的“智力”会从返工的轮次和速度上最先体现出来,藉此带来使用体感上的直观感受。


相近内容别前后重复,片尾字在云上要读得清,这些改完立即就能查。转场时观众的视线能不能有效引导、网页反向滑动能不能顺着退回来,我得先看出哪里不对,再把意见说到它能动手修改的程度。只发一句“不好看,重做”,下一版可能很努力,但继续往我不喜欢的方向走。

如何清晰合理地描述清楚自己的需求,对于任何人来说,都是在面对AI时需要考虑的问题。

两份任务跑完,GPT-6的可靠性令人印象深刻,不过消耗量也确实不低。我的Pro订阅套餐的周用量消耗了将近40%,如果换做Plus,很明显做不了太多任务。

好在整体的返工率比较低,短时间内有这样的输出质量已经让我很满意了。但这份结果,得连着中间的审改一起看。我换过方向、补过需求,也指出了它自己没处理好的问题。


如果把这些过程忽略掉,只留下最后那张漂亮截图,就容易把一次有来有回的操作,误解为发完指令就能收工的故事。

至少下次睡觉前,还是得给AI多嘱咐几句才行。

来源 | 硬核看板(ID:yinghekb)

作者 | 拥抱AI; 编辑 | 虾饺

内容仅代表作者独立观点,不代表早读课立场


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军官宣:电池起火就赔新车!半个月过去了,为什么只有雷军敢“兜底”?

雷军官宣:电池起火就赔新车!半个月过去了,为什么只有雷军敢“兜底”?

DeepAuto车探
2026-09-18 11:25:57
当年为什么查办褚时健?

当年为什么查办褚时健?

百晓生谈历史
2025-08-20 21:55:53
印度“加尔各答”号驱逐舰抵近挑衅,把自己撞出大片破损

印度“加尔各答”号驱逐舰抵近挑衅,把自己撞出大片破损

三叔的装备空间
2026-09-18 06:18:47
小县城的工资开始崩塌了。

小县城的工资开始崩塌了。

老陆不老
2026-08-26 08:38:49
西班牙专家:中日摩擦不断,非实力差距,而是80年4笔血债未清算

西班牙专家:中日摩擦不断,非实力差距,而是80年4笔血债未清算

小豫讲故事
2026-08-18 06:00:26
伦纳德:我不是那种为了追戒指 就设法加盟夺冠概率最高球队的人

伦纳德:我不是那种为了追戒指 就设法加盟夺冠概率最高球队的人

北青网-北京青年报
2026-09-17 19:57:02
广东宏远重磅引援掀热议!如果这波运作成功落地,CBA其他球队难道只能继续陪跑?

广东宏远重磅引援掀热议!如果这波运作成功落地,CBA其他球队难道只能继续陪跑?

冷桂零落
2026-09-18 09:56:21
原来王尔晴最大的依靠,不是富豪父亲,不是英国丈夫,而是他们

原来王尔晴最大的依靠,不是富豪父亲,不是英国丈夫,而是他们

九天揽月1
2026-09-18 04:32:09
“老媪”的“媪”,不读“yùn”或“wēn”,这样读太丢人

“老媪”的“媪”,不读“yùn”或“wēn”,这样读太丢人

语丝纪
2026-09-17 11:39:33
令人惋惜!2次救命机会没抓住,敬一丹遭遇,给广大老年人提个醒

令人惋惜!2次救命机会没抓住,敬一丹遭遇,给广大老年人提个醒

大鱼简科
2026-09-17 10:15:19
葡萄牙欧国联大名单将公布,曝41岁C罗不退队,距1000球仅差21球

葡萄牙欧国联大名单将公布,曝41岁C罗不退队,距1000球仅差21球

小火箭爱体育
2026-09-17 20:17:27
禁令之下,这门生意彻底转入地下

禁令之下,这门生意彻底转入地下

中国新闻周刊
2026-09-18 07:30:07
再添头衔!54岁奥尼尔获颁荣誉FBI特工 球员时期曾担任预备警官

再添头衔!54岁奥尼尔获颁荣誉FBI特工 球员时期曾担任预备警官

罗说NBA
2026-09-18 08:02:48
色是一把刀,“医美手术”缠身的王鹤棣,还是走到了这一步

色是一把刀,“医美手术”缠身的王鹤棣,还是走到了这一步

橙星文娱
2026-09-17 11:49:03
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
彻底看透!美联储加息早已不是救经济,是一场骗全世界的世纪骗局

彻底看透!美联储加息早已不是救经济,是一场骗全世界的世纪骗局

牛锅巴小钒
2026-09-17 13:39:34
深圳男子称妻子转移1400万财产?妻子:不属实,用于生活和工作必要支出了

深圳男子称妻子转移1400万财产?妻子:不属实,用于生活和工作必要支出了

封面新闻
2026-09-17 20:09:08
钱再多又有何用65岁刘德华的现状,给娱乐圈所有明星敲响警钟

钱再多又有何用65岁刘德华的现状,给娱乐圈所有明星敲响警钟

无人倾听无人倾听
2026-09-17 06:40:37
特朗普:美伊战争迎来关键节点 我面临一个重大决定

特朗普:美伊战争迎来关键节点 我面临一个重大决定

财联社
2026-09-18 02:44:03
伯恩茅斯成英超黑店,为3名球员标价3亿英镑,阿森纳冬窗有意身价1亿英镑20岁前锋

伯恩茅斯成英超黑店,为3名球员标价3亿英镑,阿森纳冬窗有意身价1亿英镑20岁前锋

福酱的小时光
2026-09-18 09:39:13
2026-09-18 12:00:49
互联网早读课 incentive-icons
互联网早读课
专注互联网产品、运营、交互
9879文章数 55228关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

手机
数码
旅游
家居
时尚

手机要闻

iOS 27.2 Beta 1代码暗示苹果CarPlay Ultra未来可联动汽车氛围灯

数码要闻

千元价位32寸2K 100Hz屏!联想来酷XQ32q显示器上市

旅游要闻

黑龙江双彩虹横跨稻田好梦幻

家居要闻

2026建博会(广州) 公装联探展交流活动

上岸的张家齐,想赚一个小目标

无障碍浏览 进入关怀版