![]()
作者 | 山竹
出品 | 锌产业
在飞机经停阿拉斯加加油间隙,拿到了”通行证“的黄仁勋终于匆匆赶到,成了这次中国之旅最后一位登机的乘客。
对于中国市场,英伟达掌舵者黄仁勋有着一肚子的期待和忧虑。
就在前不久的一档播客节目中,黄仁勋曾公开表示,如果DeepSeek这一中国领先的大模型率先在华为芯片上完成优化并高效运行,将是“对我们国家而言可怕的结果”。
黄仁勋这里提到的“我们国家”指的是美国,在此之前,美国已经禁止英伟达向中国出售“先进的人工智能芯片”,而在黄仁勋给出上述论断之前,已经有媒体爆出DeepSeek这代旗舰模型V4将全面迁移至华为昇腾950PR。
DeepSeek模型与华为芯片的深度适配正在加速中国本土算力栈的成熟,也在削弱英伟达长期构建起的生态优势。
这是老黄最不想看到的。
实际上,早在去年黄仁勋就曾多次公开表示,受美国禁令影响,英伟达在中国AI加速器市场的份额已经从约95%骤降至0%,“我们已经100%退出了中国市场。”
与此同时,黄仁勋也一再强调,中国AI的发展“无论有没有英伟达都会前进”。
从英伟达“退出”中国市场之后,中国AI市场的表现来看,也确实证实了黄仁勋的判断。
不过,作为全球AI双主线之一,中国AI市场是英伟达无法放弃的那个市场。
而深知中国AI市场重要性的黄仁勋,也就更需要这次破冰之旅。
01 AI之战,改变算力格局
在这场全球AI竞赛中,中美双线主战场格局已经悄然确立。
美国拥有OpenAI、Anthropic等在基础模型上有先发技术优势的公司,中国凭借全球最活跃的用户基础、海量的数据和最具潜力的应用市场,形成了独特的后发竞争力。
在用户、市场、创业团队三重驱动下,中国大模型迅速崛起,字节跳动豆包、阿里通义千问、DeepSeek,以及中国大模型“四小龙”、“六小虎”共同将国内大模型的热情具象化。
这其中,2025年初问世的DeepSeek,是中国大模型的一个转折点,也是全球人工智能技术发展的一个转折点。
![]()
如果说在此之前,全球大模型团队信奉的是Scaling Law,是暴力美学和大力出奇迹,那么,在DeepSeek问世后,大家开始意识到,原来大模型训练还有其他路径。
初代DeepSeek通过重新设计训练流程、以少量的SFT数据外加多轮强化学习,在提高模型准确性的同时,显著降低了内存占用和计算开销,从而极大地降低了大模型的使用成本。
如果说ChatGPT是大模型来临在西方的一个划时代标志,那么,DeepSeek则是大模型落地在东方的工程实践开端。
在此之后,我们能够看到的是,全球大模型生态像是被加入了一勺“老干妈”,开始兴奋起来,智能体在B端开始得到推广应用,甚至催生出了大模型一体机这样一类独特的时代产物。
C端也相继出现了一些智能体应用,其中成为爆款产品的,一个是由中国团队孕育而出的Manus,另一个是由美国开发者开发的OpenClaw。
![]()
大模型的战事升级,尤其是大模型从基模训练到应用落地的转变,也在悄悄影响着全球算力生态结构。
首先是在大模型传播链路中,相当一部分算力需求从训练开始向推理开始转移,市场需要的不再仅仅是高性能的GPU,异构算力成为主流趋势,这也让CPU芯片巨头英特尔迎来了新的转机;
其次是大模型在国内大型国央企的推广应用,催生了对国产算力的需求,而英伟达在一纸禁令之下,更是加大了国产算力的需求,华为、寒武纪、中芯国际等在过去两年里的产能需求不断攀升,就连国内几家互联网巨头,也在一边真金白银在投资国产GPU四小龙,一边在自研AI芯片。
![]()
一场自云计算“去IOE”之后的又一场国产化战役就此浮出水面,这其中尤以DeepSeek V4迁移至华为昇腾950PR影响最为深远。
英国路透社在4月底的一篇报道中就曾指出,在DeepSeek V4迁移至华为昇腾950PR消息一经公布后,国内包括字节、阿里、腾讯在内的互联网巨头都开始与华为接洽,商谈芯片订单事宜。
这时,距离黄仁勋公开表示英伟达已经(被迫)全面退出中国市场,仅仅只有几个月。
这样的替代进程,尤其是开发者与模型厂商逐步转向本土技术栈,让英伟达原本基于CUDA建立起的技术护城河,面临着前所未有的危机。
![]()
更重要的是,想要取代英伟达,成为下一个英伟达的,不只有华为,国产GPU四小龙的崛起,无一不是以蚕食英伟达市场份额、乃至取代英伟达为终极目标,这些“中国版英伟达”也将成为英伟达再次回到中国市场的直接竞争对手。
也是英伟达曾经在中国AI芯片市场独占95%市场份额时,不曾觉得会是威胁的竞争对手。
而在这个英伟达无法进入的全球第二大AI市场,正在构建着一个与英伟达无关的AI生态,这是如今的英伟达无法接受的。
02 英伟达,无法再一家独大
英伟达,依然是AI算力领域的绝对头部,甚至没有之一。
即便是DeepSeek V4用上的华为昇腾950PR,虽然性能已经是英伟达H20的2.87倍,但仍不及英伟达H200。
这也是英伟达曾经能在中国AI市场占据超95%份额的主要原因。
不过,也正是由于英伟达过于强大,甚至比当年的英特尔更甚(英特尔当年尚有AMD“制衡”),尤其是CUDA生态的强大,让全球科技巨头对它是又爱又怕。
爱它带来的算力强大,又怕它一家独大,自己的命运被这家公司握在手中。
![]()
因而,在国外,肉眼可见的是,无论是谷歌、亚马逊等科技巨头,还是OpenAI、Anthropic这些AI独角兽,这些算力应用大户,或在自研芯片,或在找英伟达之外的供应商进行合作。
不将自己绑定在一家供应商身上,哪怕这家供应商能够提供全球最好的产品,这似乎成了进入全球产业大分工时代后一个不成文的规定。
尤其是,在算力成本越来越成为头部科技公司的一项巨额开支时,自研芯片项目提上日程也就顺理成章。
例如,谷歌早在2013年就启动了自研TPU项目,在前不久的Cloud Next大会上,第八代TPU也正是亮相。
值得注意的是,同样是意识到了智能体规模化应用带来的推理需求暴增,谷歌在第八代TPU中首次分拆出两条独立产品线——用于模型训练的TPU 8t,以及用于实时推理的TPU 8i。
![]()
摩根大通在研报中给出的分析是:
TPU 8t采用Virgo Network fabric将集群扩展到单集群百万芯片以上,峰值性能约为上一代Ironwood的3倍,旨在压缩万亿参数级大模型的训练时间;
TPU 8i采用boardfly网络拓扑,片上SRAM提升约3倍,核心目标是突破智能体推理在规模化时遭遇的延迟与内存瓶颈。
至于另外一家科技巨头、也是云计算巨头,亚马逊自研芯片始于2018年,随后几年发展迅猛,从2025年底AWS CEO Matt Garman在re:Invent 2025上公布的数据来看,AWS已经部署了超100万颗Trainium系列自研芯片,这项业务每年为AWS带来了数十亿美元的营收。
![]()
在2026年4月底新一季的电话会议上,亚马逊CEO Andy Jassy更是直言称,亚马逊自研芯片业务在数据中心领域已经达到全球前三,如果独立运营,年营收将会达到500亿美元。
再看全球AI独角兽,OpenAI早在2023年就启动了自研芯片项目,Anthropic则在前不久对外宣布,承诺未来五年向谷歌云支付约2000亿美元,用于采购5GW的TPU算力和云服务。
在此之前,风头已经盖过OpenAI的Anthropic,分别拿了谷歌、英伟达、亚马逊的投资,并与三者均保持着AI芯片采购关系。
这样看来,我们不得不说,当年英特尔能够容忍AMD的存在,除了可以避免触及美国反垄断法律外,某种意义上而言,也为英特尔后来在全球持续扩张自己商业帝国,避免了不少麻烦。
03 英伟达,如何重新匹配中国市场?
再次来到北京,黄仁勋心情极好,在南锣古巷一路吃了炸酱面、喝了蜜雪冰城,甚至还品了老北京豆汁儿,网上一时间还传出了黄仁勋南锣古巷复刻路线。
黄仁勋之所以能有如此好的心情,与他此次作为美国总统中国之行随行人员取得的成果不无关系。
据路透社援引知情人士消息称,美国商务部已批准阿里、字节、腾讯、京东、联想等约10家中国企业购买英伟达H200芯片,每家最高可购买7.5万颗H200芯片。
对于英伟达而言,这无疑是一个天大的好消息。
![]()
我们在前文中提到过,即便是现在,英伟达H200依然是一颗很能打的芯片,也是国内不少科技巨头曾经梦寐以求的芯片。
然而,这时这颗芯片在补齐进入国内市场的手续后,国内科技巨头或许要面临另一个头疼的问题。
能买到H200,要不要买?
当然要买。
但买来后,该如何使用呢?
我们在前文中也提到过,为了降本增效,国外科技巨头都在自研芯片,如果再看国内市场,在经历过芯片禁令后,国内科技巨头自研芯片的动力更甚。
百度自研芯片早在2011年就已经开始,当时同样是为了降低芯片使用成本,阿里自研芯片则是从2018年开始,如今在国内AI算力热潮中,两家公司不约而同将AI芯片业务分离出来,其中,百度的昆仑芯也即将在港股上市。
![]()
那么,国内科技巨头自研芯片布局,会对英伟达带来怎样的影响呢?
如今的模型与AI芯片的优化是双向的,大模型的训练与推理需要与具体芯片架构深度磨合,模型开发者会针对芯片的内存带宽、Tensor Core、互联拓扑、量化支持等特性进行优化,包括算子融合、并行策略、混合精度等。
这反过来也会推动芯片架构针对主流模型负载进行迭代,形成正向循环。
英伟达CUDA的成功,正是因为它与全球领先模型共同演化,积累了海量优化库和最佳实践。
更进一步的是,芯片研发路径有时会出现“模型驱动定制”的独特模式——针对特定大模型或负载场景,开发专用优化甚至定制芯片能极大提升能效和性能,谷歌在第八代TPU中拆分出针对训练和推理场景的芯片也是类似的原因。
![]()
正因如此,如果英伟达长期缺席中国市场,必将无法参与中国领先模型的联合打磨,无法在这一全球最大应用市场积累针对性优化,这将导致其芯片在未来中国场景下的竞争力下降。
优秀的模型也能反向驱动芯片架构演进,而本土模型-芯片的闭环迭代或将催生出更适应中国数据和应用的新路径。
这一路径背后的逻辑是:
中国拥有全球约一半的AI研究人员、庞大的终端消费者和产业场景,应用创新速度极快,DeepSeek等模型的低成本高性能路径,进一步降低了AI落地门槛,让更多中小企业和行业参与了进来,算力需求随之从集中训练扩展到分布式、边缘与智能体持续运行,这要求芯片不仅性能强大,还需成本可控、易部署和生态友好,国产算力方案正是围绕这些需求在演进。
实际上,诸如DeepSeek V4率先在华为昇腾950PR上实现生态适配这样的国产模型率先在国产芯片上适配的模式,未来或将不是个例。
在这样的局面之下,英伟达如何在国内继续保持自己的生态优势,成了一个值得黄仁勋思考的问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.