网易首页 > 网易号 > 正文 申请入驻

张一鸣的「慢」,和整个行业的「快」

0
分享至


大模型的虚火还在烧。

新眸原创·作者 | 桑明强

不久前,字节跳动创始人张一鸣与Seed负责人吴永辉共同召开了一场Seed全员会,除了给团队打气,会上他还谈到了对模型蒸馏的看法:不要把蒸馏当作提升模型能力的捷径,哪怕这意味着可能会落后于国内同行。

很多人只看到了不走捷径的字节,反而忽略了它背后的战略定力。

举个例子,SP时代比短信订阅数,团购时代比覆盖城市数,O2O比地推铁军,短视频比日活。每一次大家都在比那个最容易量化、最容易写进PR稿、最容易让投资人兴奋的数字。每一次都有人在那个数字上跑到第一,然后呢?

历史的经验告诉我们,真正活下来的,从来不是数字最好看的那个。

今天的AI行业,正在把这场数字游戏玩到极致。

比参数,从百亿到万亿;比榜单,MMLU、GSM8K、HumanEval、Arena Elo一个接一个;比单项能力,谁的视频生成手指更正常,谁的代码通过率高几个点,谁的多模态又在某个benchmark刷新纪录。KOL加班做对比视频,结论永远是"国产又赢了"。朋友圈一片欢腾,仿佛AGI下周就来。

可你把目光从这些数字上移开,去问真在生产环境用AI的人,得到的多半是另一种答案。

模型在榜单上无所不能,到了具体工作里,更像个聪明但不靠谱的实习生,什么都能聊两句,真交给他一件完整的事,你还得在后面收拾烂摊子。

这就是我们今天面对的局面:参数越来越大,榜单越来越好看,热闹越来越多,可AI和真实世界之间那道沟,非但没填上,反而越变越宽

01

榜单上的胜利与现实中的困境

今年7月,月之暗面发布Kimi K3,参数精确到2.78万亿,全球最大开源模型。那天我的朋友圈被刷了屏。结果三天后的晚上,月之暗面发公告,说"用户请求量大幅超出预估,逼近现有集群承载极限",即日起暂停C端新用户订阅。

这件事本身就能说明一些问题。花这么多钱,烧这么多卡,训练出参数上碾压同行的模型,结果连最基本的用户访问都扛不住。这就像车厂造出台发动机参数全球第一的跑车,一开出来发现油箱只能装十公里的油。

另外,榜单本身的可信度也越来越可疑。今年八月,两家机构发布同月份国内AI应用月活数据,同一个豆包,一家5.28亿,另一家3.82亿,差了1.46亿。没有谁造假,只是月活这个用了二十年的指标,到了AI产品这儿突然测不准了。插件调用算不算?API访问算不算?连统计口径都没有共识,那些煞有介事的排名,看看就好。

视频生成领域的榜单竞赛,已经到了走火入魔的地步。可灵、即梦、Vidu这些,每过一端时间就有一家宣布在某个评测集登顶,KOL迅速跟进出"深度评测",结论永远是"国产又赢了"。

可你去问真正用这些工具做内容的人,他们关心的根本不是谁在benchmark上高零点几分。他们关心生成一条视频要等多久,改十次能不能有一次能用,复杂场景人物会不会崩,商用版权有没有保障。

这些问题,没有一个榜单能回答。

我想起2011年的千团大战。全国五千多家团购网站,开发布会都在说用户数、覆盖城市、单日交易额,数字一个比一个吓人。王兴那时候就讲,团购的核心不是铺多少城市,是每个城市能不能把单位经济模型跑正。没人听。大家都烧钱抢市场,烧到最后,活下来的是美团。

今天AI行业的逻辑很类似。

大家都在拼那些容易量化、容易传播、容易写进PR稿的数字,很少有人愿意碰真正难的事:怎么让模型在工业现场稳定工作,怎么让AI在零容错的金融医疗场景给出可解释、可审计的结论,怎么把推理成本降到企业愿意大规模买单的程度

这些事不性感,上不了热搜,也没法在发布会上用一张PPT展示,但它们才是AI真正进入生产体系的门槛。

苹果就是最好的例子。2024年WWDC上Apple Intelligence被吹得天花乱坠,结果跳票两年,今年WWDC才拿出像样的版本,核心能力还得靠接OpenAI和谷歌的API。发布会当天,苹果股价从盘中317美元跌到收盘301美元,市值蒸发2300亿美元。华尔街逻辑很简单:你演示的这些,ChatGPT两年前就有了,我们等了两年,就等来了这个?

这就是参数繁荣掩盖下的真相:我们在实验室里、在评测集上、在精心准备的demo里取得的所有胜利,到了真实世界都要重新打一遍折,而且这个折扣,经常大到让你怀疑人生。

02

抄作业抄不出第一名

张一鸣为什么对蒸馏这么敏感?

技术上的蒸馏本来是正经方向,用大模型输出训练小模型,让小模型在特定场景接近大模型能力,同时降低推理成本。但在今天的国内AI圈,蒸馏已经异化成了一条抄近路的产业链。

坦白地说,新模型发布流程现在高度标准化。国外发布或者更新一个新模型,最多几周时间,国内就有一堆模型宣布"在各项基准上追平甚至超越"。怎么做到的?说白了很简单:拿新模型的输出当训练数据,蒸馏到自己的模型里,再针对benchmark做专门优化。

OpenRouter有个数据很说明问题。今年1月,开源模型处理的token占比是34%,到了6月变成65%。半年翻了近一倍。开源模型突飞猛进的背后,有多少是真正的技术突破,有多少是蒸馏和benchmark过拟合带来的虚假繁荣?关于这个问题,很多人自己心里都有数。

今年7月,前OpenAI研究员Diogo Almeida发了篇博客,说当年那篇奠定Scaling Law的论文,从根上就有个bug,计算推理最优分配时算错了,导致整个行业过去五年都在训练"参数过大、训练不足"的模型。DeepMind的Sander Dieleman第一时间转发,说这个bug大概率让行业在错误方向浪费了巨额算力。

这件事最耐人寻味的是,这么多聪明人,这么多顶级公司,几年时间,上万张GPU烧进去,居然没人发现这个基础错误。为什么?

因为所有人都在同一条赛道上狂奔,没人停下来问问路对不对。大家都在堆参数,你不堆你就落后;大家都在刷榜单,你不刷你就融不到钱。路径依赖一旦形成,连质疑的声音都会被淹没。

蒸馏就是这条路径依赖的终极形态。

可问题是,抄作业永远抄不出第一名。如张一鸣所讲,你蒸馏Claude,最多无限接近它。更要命的是,这种路径依赖会从根上废掉一个团队的研究能力。当你的工程师习惯了用别人的输出训练模型,他们就再也不会去想,怎么从第一性原理出发改进模型结构,怎么构建真正高质量的数据集,怎么解决那些根本性的技术难题。

这才是张一鸣真正担心的。他看到的不是一时的榜单高低,是整个团队的创新文化会不会被捷径腐蚀。

Builder.ai破产就是很典型的例子。这家估值15亿美元的英国公司,拿了微软和卡塔尔投资局4.5亿美元,对外宣传AI可以自动写代码,客户想要什么软件几分钟就能生成。今年五月破产清算时大家才发现,所谓AI自动生成,后台是七百多个印度程序员在一行行手写代码。最讽刺的是,这家公司还上过福布斯"改变世界的50家AI公司"榜单。

这样的故事不是个例。从Humane AI Pin到Rabbit R1,过去两年倒下的AI公司已经数不清。有机构统计,2024到2026年入场的AI公司,40%已经关停,原因惊人地一致:没有核心技术,没有数据壁垒,没有真正的场景,大模型一旦更新了同样的功能,它们的存在价值立刻归零。

历史不会重复,但总是押着同样的韵脚。今天AI行业的参数竞赛、榜单崇拜、蒸馏捷径,和当年的手机参数大战、新能源PPT造车,本质上是同一件事:用容易量化的数字,回避真实场景里的艰难跋涉。

03

离开排行榜之后

什么才是真正的繁荣

当然不是说参数不重要,也不是说榜单毫无价值。技术发展早期,量化指标确实能帮我们看清进步的轨迹。但当整个行业把手段当成目的,把指标当成目标,事情就开始变味了。

移动互联网那十年的繁荣,不是因为手机芯片从单核跑到了八核,是因为iPhone重新定义了智能手机,是微信、支付宝、美团、滴滴这些产品,真正改变了十几亿人吃饭、出行、社交、付钱的方式。特斯拉带动的新能源革命,也不是因为电池能量密度每年提升几个百分点,是它证明了电动车可以比燃油车更好开、更智能、更便宜,把整个产业链带了起来。

这些繁荣背后当然有技术参数的进步,但参数是结果,不是原因。真正驱动繁荣的,是技术和真实需求的深度结合,是产品在具体场景里创造的真实价值。

今天AI行业的问题,恰恰在于太多人把参数当成了原因。

他们觉得只要模型足够大,一切问题都会迎刃而解;只要榜单分数足够高,商业化自然会来。可现实是,GPT-4到GPT-5,参数翻了几倍,能力强了不少,但真正愿意为AI付费的个人用户并没有几何倍数增长。很多企业买了大模型API,用了几个月就发现,除了写文案做总结,好像也找不到更多真正能落地的场景。

麦肯锡有个报告(《The State of AI in 2025》),2025年企业在AI上的投入比前一年翻了一番,但真正把AI部署到核心生产流程的比例,只从12%涨到了16%。剩下的84%,要么还在做POC,要么用了几次就扔在那儿了。钱花了,热闹看了,最后发现AI并没有像预期那样重构业务流程。

为什么会这样?因为真实世界太复杂了。

你在实验室里训练模型,用的是干净的、标注好的数据。可到了工业现场,传感器数据是有噪声的,生产环境是动态变化的,很多关键参数根本没法直接测量——催化剂的活性、热态工件的变形量、化学反应的中间状态,这些东西你连数据都采不到,模型再大,有什么用?

你在评测集上做数学题正确率99%,可到了金融风控,一个错误判断可能就是几千万损失;到了医疗诊断,一个幻觉可能就是重大事故。这些场景要求的不是99%的正确率,是六个九、七个九的可靠性,是每一个决策都可解释、可追溯、可审计。

这也是为什么真正在产业里深耕的人,对那些天花乱坠的模型发布越来越淡定。

好消息是,已经有人开始往这个方向走了。

微软今年财报会上,纳德拉讲的重点已经不是Copilot又加了多少参数,是财富500强里有多少家在用Azure的AI平台,是Copilot Studio里企业自己搭建的Agent数量,是商业模式从席位订阅转向"席位+按量计费"。谷歌在Gemini at Work上展示的,也不是什么炫酷demo,是大众、华纳兄弟、Snap这些公司怎么把Gemini真正嵌到生产流程里。国内的腾讯WorkBuddy、阿里QoderWork、字节TRAE、金山WPS AI,也都在做同样的事——不再比谁的模型更聪明,开始比谁能更深度地嵌入工作流,谁能真正帮用户解决问题。

当然,这条路注定更难走。它要求你沉到行业里去,理解客户的真实痛点,和客户一起打磨产品,忍受很长时间没有高光时刻的寂寞。它不像发布一个万亿参数模型那样能上头条,不像刷到榜单第一那样能让投资人兴奋,也不像KOL的评测视频那样能带来潮水般的流量。

但这才是真正的AI浪潮该有的样子。

本文系新眸原创,申请转载授权、商务合作请联系微信:ycj841642330,添加好友请备注公司和职位。

更多内容,点击下方关注

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
高志凯提议中国:代表全人类宣布月球主权,谁反对就来月球谈

高志凯提议中国:代表全人类宣布月球主权,谁反对就来月球谈

温读史
2026-09-22 03:40:49
2026-09-24 23:32:49
新眸深度 incentive-icons
新眸深度
看见商业另一面。
1639文章数 2485关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

房产
教育
数码
本地
公开课

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

教育要闻

开车导航出成题,能写出高分作文?导航绝不批评你,只是重新为你规划路线

数码要闻

铭凡推出UM780L Slim迷你主机:0.77L体积,板载LPDDR5X-7500

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版