志明与春娇,AI看小刀,大家好,我是刀哥,今天给大家讲讲DeepSeek V3.2不为人知的秘密
昨天下午DeepSeek V3.2发布,今天凌晨Claude Sonnet 4.5发布,大家很关心技术细节。其实Claude 4.5领先的那一点点编程上的技术优势,不出3个月就会被国产后来者赶超。
而DeepSeek V3.2 发布公告里边的一段话却非常非常重要,不得不说,从V3.1开始的伏笔,已经开始大展宏图!
咱们从2025年初到现在,按时间线捋一捋。
春节突袭
大年初四,华为云和硅基流动把基于昇腾云的DeepSeek服务上线了。意思很直白:模型到算力,尽量用国产堆起来。
结果一上线就挤爆。原本准备的910B卡很快顶满,只能连夜紧急加卡,才把服务稳住。那天之后,很多人第一次直观感受到:国货之光来了,国产大模型第一次热起来了。
从2023年,李彦宏说文心一言离GPT4只差一两个月的笑柄,到DeepSeek的迎头追上,我们用了两年时间!
![]()
适配优化,蛰伏期
2025年3月初,华为CloudMatrix 384超节点上线,384张昇腾卡互联,初期吞吐指标不漂亮,大家一边踩坑一边补齐软硬件配合,芯片—算子—框架—调度一层层抠。
4月10日的发布会上(华为云生态大会),对外报了一组关键数字: 在50ms时延约束下单卡Decode吞吐突破1920 Tokens/s ,对比初期提升显著,有对标H100的意思。
同时还有一条更“现实”的:在910B上推理的单位成本,按官方给的口径明显压下来了,量级级别的下降,至于有人说到“每百万token 0.27美元”这种超细数字。
协同优化:模型从设计期就盯国产芯片特性
8月,DeepSeek发了V3.1。思路很清楚:推理时支持“思考/非思考”两种模式,配合混合推理策略;底层精度上更多用FP8/低精度量化方案,目标就是在不明显损伤效果的前提下,把吞吐、时延和成本继续压。
最关键的一句:这套设计从一开始就对国产芯片的算力特点做了适配。换句话说,不是先做个通用版再硬塞到国产芯片上跑,而是“模型-框架-芯片”一起调。这个路径对国产生态很重要。
这次的V3.2 ,第一段只说了效率优化和新机制引入
![]()
其实大招在后边!
“使用高级语言 TileLang 进行快速原型开发,以支持更深入的探索。在最后阶段,以 TileLang 作为精度基线,逐步使用底层语言实现更高效的版本。”
![]()
这里必须介绍下 TileLang。 TileLang是一门主要面向AI计算的开源编程语言,它的核心目标是让开发者能更轻松、高效地编写出高性能的AI算子(即计算核心),从而解放生产力。
在2025年华为全联接大会上,北京大学团队展示的TileLang成果已成功应用于华为的昇腾(Ascend)AI芯片平台。我们不跟英伟达玩了,华为昇腾香起来了!
DeepSeek发布完半小时,华为官宣:
华为宣布昇腾已快速基于 vLLM/SGLang 等推理框架完成适配部署,实现 DeepSeek-V3.2-Exp 0day 支持,并面向开发者开源所有推理代码和算子实现。
![]()
这不是明摆着,事先就准备好的公关稿,事先就适配好了新模型吗?
生态发力:不是一家独唱,而是一起上牌桌
9月开始,国产算力这边的新闻密度明显提高。
阿里平头哥在通用并行处理/AI方向的自研芯片有新进展,媒体报道里多次提到“对标高端GPU档位、强调成本优化”。号称“超过A800/比肩H20、降本40%”
华为给出了昇腾路线的更清晰节奏,软硬件配套在国内场景里落地速度在加快。
GPU创业公司摩尔线程IPO进程的推进和审核节奏明显提速。用市场行为说话:资金对“国产算力能跑起来”这件事,愿意下注。
这不是“替代”的单点突破,而是“可用-好用-便宜可规模”的系统工程开始见效。
格局变化:从“备胎”到“优选”
梁文峰与最高领导人的会面,被外界解读为国家层面对其技术路线和发展方向的高度认可。这不仅是个人的荣光,更是整个行业的强心剂。
过去一年最大的变化,是认知层面的:越来越多团队在产品方案评审里,会优先按国产芯片的特性来做模型/工程设计,而不是“能不能先用国外方案救急”。
多家机构的测算都在强调一个趋势:NVIDIA在国内的份额在回落,本土AI芯片份额抬到“约三成区间”已是普遍预期。
规模这块,行业预测2025年的国内“智能算力”总量会迈过“千EFLOPS”门槛。
1 EFLOPS = 每秒100亿亿次计算(1后面跟着18个零,即 10¹⁸ 次浮点运算)。
所以,1037.3 EFLOPS = 每秒能完成 1037.3 × 10¹⁸ 次计算。
一张RTX 4090在AI常用精度(如FP8)下的理论算力约 1.3 PFLOPS(即0.0013 EFLOPS)。要达到1037.3 EFLOPS,理论上需要 约80万张RTX 4090 同时满负荷运行——还不算通信、调度、软件损耗。现实中,可能需要超过100万张才能稳定输出这个水平。
从“有没有”到“好不好用、贵不贵”,国产算力正在进入“比性价比、比可获得性”的阶段。
后记
君不见,码农炒股群里,从言必称FAANG,美股七姐妹,到现在中际旭创、新易盛、胜宏、寒武纪聊得飞起,重仓科创,中国公司再不是当年的吴下阿蒙,不是缅A,大家开始了价值投资。
世界大舞台,中美同台竞技,中国不再落后挨打。
![]()
从模仿到自立,从追赶到协同,我们正在书写属于自己的AI新篇章!
后台回复【deepseek】,一起聊聊DeepSeek的这次更新。
不刷短视频,读我的公众号长文还读完了?您真是一股清流!如果觉得写得不错,欢迎点赞、在看、关注。如果有不同看法,欢迎在评论区或者后台留言讨论。
我是刀哥,大厂工作过几年,现在是出海创业者,深入研究AI工具和AI编程。关注我,了解更多AI知识!我们下期再见!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.