字节跳动创始人张一鸣在近期的一场内部会议上明确表态:即便Seed的模型能力暂时落后于国内主要竞争对手,字节也不会用"蒸馏"的方式来加快大模型训练的速度。他还补了一句更重的话,字节应该愿意为长期目标,牺牲一些短期收益。
![]()
其实,最该急着"抄作业"抢榜的,恰恰就是字节。据新浪财经援引的数据,截至2026年6月,豆包App月活用户已达3.82亿,日均Token调用量180万亿,字节大模型业务ARR达到40亿美元, 这是全行业最硬的C端家底,但在模型能力上却没进入各大榜单,处于落后的态势。
手里握着这么大的牌,张一鸣却带头喊"慢慢来",这份战略定力是基于什么考量?
先说为啥不少企业热衷于“蒸馏”。2015年,"深度学习之父"辛顿提出了这个概念:让算力充沛的大模型当"师傅",轻量级的小模型当"徒弟",徒弟观察师傅的输入输出,复刻师傅的思路。
其实,这跟咱们读书时"抄作业"是一个路子,只不过抄的是模型内部的知识。据公开信息,马斯克训练Grok在用蒸馏,谷歌专门提供蒸馏服务,英伟达创始人黄仁勋甚至说,人类的知识传承本就是一场永无止境的互相蒸馏,又快又省,谁不心动?
![]()
那张一鸣为什么公开表示,字节不要去做蒸馏?我觉得有三点原因,
第一,蒸馏看着省力,其实是透支。字节内部不只限制对美国前沿模型的蒸馏,对开源模型同样严禁,甚至用API检测等手段加强管控,团队的核心判断是,蒸馏会干扰真正意义上的长期技术突破,榜单刷上去了,自己的"内功"没练出来。
第二,这是主动选择,不是被逼的。梁汝波在字节全员会上特意反驳:有外部报道说字节是因为压力才坚持自研,"这是瞎猜的",真实原因是希望团队延迟满足感、打好技术基础,这对长期实现AGI很关键。
第三,张一鸣的态度一直是"动作不要变形",宁可接受大模型一段时间的落后,也要坚持优化长期。
把镜头拉到隔壁DeepSeek,打法完全不同。DeepSeek没那么多C端流量护体,靠的是极致性价比,4月底V4-Pro开2.5折,5月转成永久定价,把同行逼得集体降价,被圈内称作"模型斩杀线",它必须跑快,因为没家底可以慢慢耗。
而字节不同:豆包月活3.82亿、日调用180万亿,牌在手里,才敢说"我按自己的节奏来"。两种打法谁对谁错,时间会说话;但至少,有底牌的人选慢,才叫底气,没底牌的人选慢,那叫躺平。
![]()
我觉得字节这种体量的公司愿意为长期目标放弃短期榜单,它做出来的产品,就更值得放心用;往大里说,手里有粮的人不慌,你兜里攒着存款,才敢挑活儿干,背后有字节源源不断的投入,再加上战略定力,即使最后的结果没有超过预期,但我觉得还是会很不错的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.