好莱坞演员本·阿弗莱克最近在一段分享里,聊的不是剧本,而是开源视频模型怎么微调。他说得很具体:先冻结基础权重,学习率设成 2e-4,然后只训练最后一层"电影感"相关的参数。
这套说法来自 Thomas Wolf 在 X 上的一条帖子。帖子里还带了一句调侃——Karpathy 从 X 上消失了,阿弗莱克倒是接上了话,招呼大家"围过来"听他讲参数怎么调。
![]()
他到底在调什么
按阿弗莱克的说法,做法是解冻权重,但只训练最后一层"cinematic layer"(电影质感层)。目标不是让模型生成随便一段视频,而是让成片能达到真实剧组的生产标准。
换句话说,他关心的不是模型能不能跑通,而是输出能不能直接进片场用。这个诉求和大多数开发者调模型时的关注点不太一样——后者往往先看指标,他先看能不能过拍摄这一关。
他为什么有资格聊这个
阿弗莱克的身份不只是演员,他还是 Artists Equity 的 CEO。这家公司是他参与创办的影视制作公司。
更早一点,他在 2022 年创办了 InterPositive,一家 16 人规模的公司。从时间线看,他对视频模型微调的关注不是临时起意,而是有一条自己的业务线索在支撑。
一个 16 人的团队,加上一个演员兼 CEO 的身份,去碰开源视频模型的微调——这件事本身就有反差。通常这类工作出现在实验室或大厂内部,现在被一个好莱坞团队拿来做,而且谈的是学习率这种具体参数。
值得留意的信号
他提到的"冻结基础权重、只训最后一层",是微调里比较常见的省算力思路。把它用在视频模型上,指向的是一种现实需求:剧组要的是可控、可复现的画面质感,而不是每次生成都开盲盒。
阿弗莱克把学习率 2e-4 这种细节摆到台面上讲,说明这套流程在他那边已经跑过,不是概念层面的讨论。至于效果能不能真的达到"production standards",他没有给出更多数据。
从 InterPositive 的 16 人规模,到 Artists Equity 的 CEO 身份,再到公开聊开源视频模型微调——这条线索串起来看,影视行业对生成式视频的介入,正在从"试用工具"往"自己调模型"走。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.