10万亿参数是什么概念?
DeepSeek-R1的参数量是6710亿,10万亿是它的十五倍。阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。也就是说,10万亿这个数字,是国产已发布模型里最大那个的四倍还多。
华为CANN社区10月5日公开了一份技术文档,标题叫《基于昇腾950超节点的万亿MoE模型预训练系统参考实践》。里面在讲DeepSeek预训练支持时,明确提到“分析550B、1.6T模型的切分策略,以及向10T规模外推时的部署权衡”。
这是DeepSeek公开技术材料中,模型规模第一次触及10万亿参数量级。
我花了一个晚上把这份文档翻了一遍。技术细节很多,但普通人真正该关心的,其实是另外三件事。
10T模型能做什么,得先搞懂MoE
很多人看到“10万亿参数”第一反应是:这跟我有什么关系?
要回答这个问题,得先理解一个概念。DeepSeek用的是MoE架构,全称混合专家模型。
打个比方。稠密模型像一个全能选手,什么问题都得自己上,你问它什么它都要调动全部脑细胞。MoE模型像一个团队,里面有擅长写代码的、擅长翻译的、擅长做数学题的。你问代码问题,只叫代码专家出来,其他人不用动。
总参数是团队总人数,激活参数是每次实际干活的人数。 DeepSeek-V3总参数6710亿,但每次推理只激活约370亿。
DeepSeek V4-Pro的总参数是1.6万亿,激活参数49B。V4-Flash更极端,总参数284B,激活只有13B。
10万亿参数的MoE模型,总参数涨了,但激活参数不一定同比例涨。这意味着它的能力上限大幅提升,但推理成本不会等比例飙升。
所以10T模型能做什么?更强的推理能力、更长的任务链、更复杂的多步骤规划。这些“没见过的新能力”,往往先出现在最大的模型上,再慢慢下放到你手机里那个免费的AI助手。
![]()
华为昇腾的方案,到底解决了什么问题
翻完文档,我觉得最有价值的信息藏在“部署权衡”这四个字里。
训练一个10万亿参数的模型,不是把更多芯片堆在一起就能跑起来的。模型大了,显存不够用、芯片之间通信变慢、计算效率下降,这些都是硬骨头。
华为的方案里,有几个关键设计。
一个是FSDP、EP、CP三层并行策略。简单说就是把模型切碎,分布到不同的芯片上去。切法很有讲究,切不好就会出现“有的芯片忙死,有的芯片闲着”的情况。
另一个是FlexMuon分布式优化器,针对参数布局重组、层级流水做了优化。还有GraphTrainer,通过图像映射来编排通信和计算,减少串行等待。
昇腾950超节点以单机柜64张NPU卡为基本单元,最大支持8192张NPU卡高速互联。 这是个什么规模?8192张卡同时跑一个模型,通信延迟控制不好的话,训练效率会大打折扣。
DeepSeek V4已经在这套硬件上跑出了实际数据。V4-Pro在8K输入场景下,单卡Decode吞吐4700TPS,TPOT约20ms。V4-Flash单卡吞吐1600TPS,TPOT约10ms。
这些数字什么水平? 够用。不是最顶尖,但已经能支撑起大规模推理服务。
![]()
跟阿里比,DeepSeek的路线有什么不同
阿里在9月云栖大会上宣布,下一代Qwen模型计划扩展到5万亿到10万亿参数。CEO吴泳铭亲自站台,说这是“迈向超级人工智能的关键路径”。
DeepSeek创始人梁文锋在投资者会议上说过一句话,大意是:算力资源撑不住10万亿的训练,即使训出来了,研究所需的算力也远远不够,不如优先做好几千万激活的模型。
这两条路线其实不矛盾。
阿里在推“递归式自我改进”,Qwen3.8-Max已经在无人参与的情况下自主搭建训练流程、构造数据、设计实验,持续迭代超过一个月,完成33轮有效迭代。这条路走的是让AI自己改进自己。
DeepSeek在推“性价比路线”,用更小的激活参数打出旗舰效果,同时通过CANN社区的技术文档展示自己有能力向10T外推。这条路走的是“我有能力做大,但现在不做”。
从产业角度看,字节也在训练10万亿参数模型,据报需要约3万张GPU连续跑三到六个月。三家都在往同一个方向走,只是节奏不同。
![]()
训练成本是什么量级,API会涨价吗
聊完技术,说点实际的。
训练一个10万亿参数的MoE模型,需要数万甚至十万级别的AI加速卡,训练周期数月。仅算力硬件投入就是百亿级别。电费、集群运维、芯片采购,每一项都是天文数字。
有人估算,如果用英伟达GB200/GB300构建集群,光硬件成本就可能达到180亿美元。
但这笔钱跟你的API账单关系不大。
MoE架构的特点决定了,10万亿参数的模型不会让每次推理都跑10万亿次计算。真正影响你使用成本的,是激活参数而不是总参数。
DeepSeek在8月已经涨过一轮价了。V4-Pro高峰时段输出价格从6元涨到27元/百万tokens,缓存命中输入价格从0.025元涨到0.3元。V4-Flash空闲时段输入缓存未命中1.5元/百万token,输出4.5元。
10T模型短期内不会直接替代V4系列。它更像是一个“储备项目”,用来探索能力上限,等成熟了再逐步下放。你日常用的还是V4-Flash和V4-Pro,价格不会因为10T项目就突然跳涨。
![]()
这件事跟你到底有什么关系
回到最开始的问题:10万亿参数,普通人需要关心吗?
如果你只是用DeepSeek聊天、写东西、做表格,短期内感知不到差别。
但有两件事值得留意。
一是能力下放。10T模型探索出来的新能力——更强的推理、更长的任务链、更复杂的规划——迟早会流到日常产品里。就像几年前只有超大模型才有的代码补全能力,现在你手机上的免费AI也能做。
二是国产算力的进展。DeepSeek V4从训练到推理已经完整适配了华为昇腾NPU,自研的细粒度专家并行方案在昇腾上实现了1.50到1.73倍的加速比。梁文锋甚至说过,华为950超节点可以完全平替英伟达GB300。
这句话的分量在于:这意味着国产芯片已经能撑起万亿参数模型的训练和推理,不是只能做小模型的玩具。
昇腾950DT预计2026年第四季度推出,DeepSeek计划在内蒙古乌兰察布的数据中心部署至少16万颗昇腾950DT芯片。
当算力不再被卡脖子,模型能跑多大这件事,就变成了一个工程问题,不是资源问题。
10万亿参数是一个信号。它说明中国AI公司已经开始认真思考“能力天花板”这件事,而不只是“怎么把成本打下来”。
对普通人来说,最好的态度可能是:不用焦虑,但别忽视。 那些今天在10T模型上跑通的能力,三年后就是你手机里那个AI助手的标配。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.