黄仁勋解读全栈设计、推理能耗、智能体架构,深度驳斥 AI 威胁论
2026 年 6 月 10 日
![]()
2026年5月,英伟达首席执行官黄仁勋应邀在斯坦福大学CS 153前沿系统课程上发表演讲。
黄仁勋经常提到一个数字,很多人都理解错了:一百万倍。这指的是过去十年,英伟达将整体算力提升了一百万倍;而如果仅依靠摩尔定律,同期算力增幅仅有十倍。
正是这种差距才让人工智能得以落地生根。也正因算力迎来爆发式增长,科研人员得以使用全网海量数据训练模型,无需再人工精挑细选数据集;各行各业的变革也提前到来,而非等到 2040 年。
本文深度拆解黄仁勋在斯坦福大学前沿系统课程上的演讲精华,整理出十大核心要点,适合所有创业者、企业管理者与投资人参考学习。
1. 算力百万倍增长的核心逻辑,是未来十年最重要的战略启示
摩尔定律放缓已持续十年之久。
“依托全栈协同设计模式,英伟达在十年间实现了十万倍至一百万倍的算力提升。达到这个量级后,具体数值区间已经不再重要。”
2015 年前后,登纳德缩放定律失效。失去这一支撑后,摩尔定律十年内可能仅能实现十倍左右的性能增长。半导体物理的发展已经触及瓶颈,但英伟达依旧完成了百万倍的算力突破。
实现突破的核心就是协同设计:将中央处理器、图形处理器、网络设备、交换机、存储、软件以及编译器围绕同一目标同步优化,而非让各个团队各自负责单一模块。正是这套垂直整合逻辑,让一家硬件企业实现了收益的复利增长。
黄仁勋以精简指令集架构(RISC)举例佐证:斯坦福大学学者约翰・亨尼斯早已证明,编译器与精简指令集协同优化,效果远优于两套系统独立迭代,整体效能始终大于各部分效能之和。将这套逻辑应用到完整计算架构中,便能实现百万倍级的性能飞跃。
算力暴涨,不只是让计算机运行速度变快,更是开辟了全新的发展空间。当算力提升百万倍,科研人员不再纠结数据筛选,而是直接使用全网信息开展研究。现代 AI 的诞生,依靠的并非某一项算法突破,而是这套全新的设计理念。
行动建议: 在做架构规划前,先判断你是在单独优化某一模块,还是在开展跨层级的协同设计。这个答案,决定了你团队的发展上限。
2. 斥资数十亿打造无人问津的系统,第一性原理是决策底气
目前市面上售价最高的传统超级计算机,造价约为 3.5 亿美元。
“我们打造的系统耗资数十亿美元,放眼市场,当时没有任何潜在客户。市面上最贵的同类产品仅 3.5 亿美元,我们的产品体量远超于此,相当于在一个零需求市场布局。”
黄仁勋没有依赖传统市场调研,而是用第一性原理推演行业趋势:大模型预训练的算力需求未来会呈指数级上涨,支撑大规模训练的系统造价也会创下新高。即便当时暂无明确客户,英伟达依旧毅然投入研发。后来的 Hopper 架构(如 H100)正是基于这一判断打造,产品落地之时,生成式 AI 的爆发让市场需求恰好全面爆发。
这件事带来的启发,远不止“逆势布局”这么简单。市场调研只能反映客户当下的需求,而第一性原理思维,能结合技术底层的本质规律,预判客户未来的刚需。前者立足当下做优化,后者着眼未来做布局,优秀的创业者总能分清二者的区别。
行动建议: 复盘你核心产品的布局思路,判断决策依据是用户访谈、竞品分析,还是第一性原理推演。如果无法区分,这就是当下最需要解决的战略问题。
3. 推理环节才是 AI 盈利核心,多数团队都找错了优化方向
训练赋予模型智能,推理让智能落地商用,整个 AI 产业的商业价值都围绕推理环节实现。
“对比上一代产品,我们两年内将推理性能提升了 50倍。而按照摩尔定律,同期性能增幅仅为 2 倍。”
绝大多数工程师都搞错了核心瓶颈:文本生成(LLM推理)本质上属于带宽受限型任务,而非算力受限型任务。 预填充阶段负责处理上下文信息,解码阶段负责逐一生成文本;解码环节对内存带宽(Memory Bandwidth)的需求极高,单颗芯片根本无法承载,这也成为整个流程的短板。
英伟达推出 Blackwell NVLink 集成互联架构,将数十颗芯片整合为机柜级一体化计算系统,直击内存带宽瓶颈,在两年内实现 50 倍推理性能提升。协同设计的复利效应就此显现:十年百万倍的算力飞跃,正是由一次次数十倍的性能提升叠加而来。
不少团队一味死磕 MFU(模型浮点运算利用率),实则选错了考核指标。黄仁勋认为,宁可预留充足冗余、保持较低的运算利用率,也不要为了跑满 100% 的表面指标,导致各类业务负载(Workloads)都受到阿姆达尔定律(Amdahl's law)的严重制约。优化要直击真实瓶颈,而非执着于容易统计的表面数据。
行动建议: 梳理团队当前的研发与工程优化指标,剔除那些看似漂亮、实则和核心性能/成本瓶颈无关的考核项。
4. 斯坦福坐拥 400 亿捐赠基金却无超级计算机,问题不在芯片而在机制
当下在宏观上并不存在绝对的芯片短缺问题,真正的症结在有些机构的预算架构不合理。
“顶尖高校的各院系通常独立申请科研经费,单笔资金规模有限,不足以搭建共享的大型顶级计算设施;各部门资源互相割裂,最终整座校园里师生都只能使用普通笔记本或租用零散算力,全校没有一台共享的超级计算机。”
黄仁勋给出了非常直接的解决方案:斯坦福手握 400 亿美元捐赠基金,只需划出 10 亿美元,对接主流云服务商,当年就能让全体学生用上顶级 AI 超级计算机。芯片和资金都可以协调,阻碍发展的是落后的资源分配机制。
关于管理与权责,他的观点尤为犀利:当你告诉团队“这不是你们的错(Fault)”时,其实也无形中剥夺了他们的主观能动性(Agency)——因为责任与掌控权本质上是一回事。将问题归结为“客观条件不足”,往往是在逃避解决问题的主动权。
大型企业也普遍存在同类问题:预算分散、算力资源形成部门壁垒,全员都高喊算力不足。能够率先打破壁垒、统筹整合算力资源的机构,将主导未来十年的行业发展。
行动建议: 盘点团队当前所有的算力与数据资源,梳理出分散闲置、可统筹复用的部分。将其定性为公司管理与预算架构问题,而非外部资源短缺问题。
5. 上一次计算领域迎来颠覆性变革在 1964 年,以此为节点复盘产品逻辑
这是一场彻底的行业重构,而非普通的技术迭代。
“如今,软件开发模式、神经网络运行逻辑、应用能力边界都发生了巨变,整个计算体系迎来根本性革新。”
1964 年,IBM System/360 计算机确立了沿用至今的通用计算范式。此后的个人电脑、互联网、移动设备、云计算,全都建立在这套体系之上:软件由人工预先编写并编译成二进制文件,计算机严格执行既定指令。这套模式整整沿用了 60 年。
而神经网络的运行逻辑和传统编译代码截然不同,彻底打破了旧范式的所有固有认知:
- 软件开发重构: 软件不再依靠人工逐行编写,而是通过数据训练(Training)自动生成;
- 内容生产重构: 内容不再是从存储器中静态调取,而是由大模型实时动态生成;
- 人机交互重构: 计算机不仅能被动执行显性指令,还能深度理解人类的模糊意图;
- 能力重构: 以往依赖人类高阶感知能力才能实现的应用,如今借助端到端 AI 均可高效落地。
英伟达的端到端自动驾驶训练集群就是最好的证明。在传统计算架构下,自动驾驶技术因长尾场景迟迟难以突破;而全面转向深度学习后,整个赛道迎来全新发展机遇。真正的行业重构,是开辟全新可能性,而非在原有基础上小幅提速。
行动建议: 深入复盘你公司产品的底层逻辑,找出哪些模块仍被束缚在传统计算范式中。这些过时的假设,要么隐藏着你最大的覆灭风险,要么孕育着你最大的时代机遇。
6. GPT 问世便注定智能体时代到来,先行者已提前搭建底层基建
生成式 AI 的价值,不只是生成漂亮的图文内容,幕后是让“思考过程”变得肉眼可见。
“模型内部生成 Token,本质就是思考;对外输出 Token、调用工具,就是工具使用。因此在几年前 GPT 推出时,当下的智能体发展趋势就已经可以预判。”
在黄仁勋眼中,GPT 不只是聊天机器人,文本生成的底层机制本身就在模拟人类思考。模型内部生成的字符对应逻辑推理,对外生成的字符对应工具调用,智能体(Agent)的爆发是技术演进的必然结果,而非凭空设想。
从 GPT 落地至今,业内攻克了诸多工程难题:实现大规模分步推理训练、优化模型稳定性、完善配套工具链。只要吃透底层技术原理,行业走向是完全可以清晰预判的。
当下的趋势同样明朗:智能体时代全面到来,持续型计算(Continuous Computing)正在逐步取代传统按需调用的计算模式。所有基于旧模式搭建的系统,都需要重构。早早看清趋势、布局底层基建的创业者,如今已进化为行业的上游服务商。
行动建议: 结合当前大模型分步推理的技术现状,预判下一阶段智能体对基础设施的需求并提前落地布局。如果暂时无法做出判断,补齐团队的技术原理认知是首要任务。
7. 开源模型并非公关博弈,三大核心价值远超表面噱头
英伟达在内部业务中调用 Anthropic、OpenAI 等闭源模型的频次位居全球前列,但这和他们大力布局开源模型并不矛盾。
“全球有众多小语种,主流实验室不会将其列为优先研发重点。如果没有机构主动深耕,这些语种的 AI 应用永远无法发展成熟。”
开源模型有三大长期被行业低估的核心价值:
- 覆盖边缘语种与文化: 全球有两百多种语言难以得到顶级闭源实验室的深度微调支持。英伟达开源 Nemotron 等模型,让各地科研人员无需从零起步,就能针对本土语种进行定制优化,这是服务全球智能化的重要基建。
- 融入人类先验知识: 最新的 AI系统不再是盲目堆砌纯数据,而是将语言模型与世界认知模型(World Model)结合。依托人类过往的先验经验,系统仅需数百万公里训练数据即可在特定工程领域成型,远少于传统方案所需的数十亿公里,大幅降低对极限数据的依赖。
- 安全可控与透明性: 闭源黑盒模型会让网络安全陷入无序的军备竞赛,漏洞极难排查。开源透明才是安全防护的基础。
行动建议: 针对企业自研或正在使用的领域专用模型,尝试融合搭载人类先验知识的轻量化开源模型,判断能否在特定工作负载中减少对海量数据的依赖。
8. Rubin 并非新型训练芯片,而是首款专为智能体设计的计算机
智能体的运算模式,和传统大模型的集群训练(Training Cluster)完全不同。
“一套造价数十亿美元的 AI 系统发出工具调用指令,任务会转由 CPU 执行。而整套高端 GPU 集群,只能原地等待单颗 CPU 完成工作。”
传统云计算架构,根本无法适配智能体的三大核心运行需求:
- 极低延迟的长期记忆: 智能体的记忆必须存储在与处理器直连的高速存储设备中,传统网络存储的数据传输延迟会严重拖慢效率;
- 高单线程性能: 工具调用极度依赖 CPU。但传统云端 CPU 主打并行吞吐量(多核心独立任务),而智能体恰恰相反,需要单线程、极低延迟的串行运算能力。这导致昂贵的 GPU 集群常会因为等待单个 CPU 线程而陷入停滞。
因此,存储与 CPU 架构都需要围绕智能体的运行逻辑重新设计。英伟达未来的 Rubin 架构以及下一代 Vera 架构,便是为此而生,它们的大概率演进方向正是面向多层级、套娃式的“智能体集群控制(Agents running sub-agents)”场景。这套方法论十分明确:先理清真实运算模式,找准与传统架构的差异,再针对性搭建系统。
行动建议: 深度梳理你当前智能体任务的运算流程,定位延迟产生的关键环节。如果你的架构与智能体业务不匹配,这个架构缺陷就是你目前面临的性能天花板。
9. AI 能耗或将暴涨至当前千倍,行业趋势已逐步形成
继芯片之后,能耗成为第二大核心瓶颈,这一趋势已经持续多年,但很多人至今后知后觉。
“未来 AI 计算所需能源,大概率会达到目前的一千倍。即便最终数值和这个预估存在几个数量级的差距,也在情理之中。”
背后是计算模式的结构性变革:传统计算为按需检索模式,服务器闲置待命,收到请求后响应,完成任务再次休眠,能耗和查询次数线性挂钩。而新一代 AI 是生成式持续运行模式,模型全天候在线、实时感知信息并持续推理。二者的能耗逻辑截然不同。
面对能耗瓶颈,行业领先者通常手握两大优化方向:
- 微观层面: 极致提升“单位能耗的内容生成效率(Tokens per Watt)”;
- 宏观层面: 从芯片底层出发,通过全栈协同设计,实现机柜级和数据中心级的整体能效优化。
外部机遇则来自能源基建。几年前,太阳能、核能等新能源还需要政策补贴才能维持运营;如今 AI 庞大的算力需求,正推动市场资本自发、主动地涌入新能源建设。当下是发展可持续能源的黄金时期,旺盛的市场需求足以支撑清洁能源产业资本实现长周期自主循环。
行动建议: 在评估或开发推理链路时,将“单位能耗Token产出”列为战略级指标。未来三年,在该维度保持领先的团队,将形成难以被跨越的成本护城河。
10. AI 末日论毫无依据,这类论调本身就无法被证伪
在 AI 风险与安全防护这个话题上,黄仁勋态度鲜明,毫不妥协。
“所谓‘人类无法理解 AI 运行原理’‘AI 会瞬间变得超强并掌控世界’,全都是无稽之谈。”
典型的末日论调认为:AI 会在某个未知时间点突然实现能力爆炸,人类无法预判、无法防御,甚至文明都会受到威胁。
黄仁勋的反驳有理有据:人类从数学和工程上早已掌握 AI 系统的运行原理,模型能力是随着技术投入、计算算力和架构迭代稳步提升的,安全防护体系也可随着版本的演进进行落地测试。整个行业发展轨迹清晰可预判,和“AI 突然瞬间失控”的叙事完全相悖。理性探讨 AI 安全和治理,与刻意制造恐慌的末日论,有着本质区别。
这类不实言论危害深远。很多优秀的学生和年轻人正在选择专业方向,舆论会左右他们的判断。如果年轻一代被灌输了“AI 充满未知危险”的恐惧,大家会转向政策主张限制技术发展,而非投身基础研发,最终将技术赛道拱手让人。
GPU 属于通用计算设备,全球数十亿人都在使用,广泛应用于医疗影像、物流调度、气候模拟等领域。将 AI 粗暴地类比为原子弹,会严重扰乱理性思考,基于这类叙事制定的政策,也必然偏离正轨。
行动建议: 看到各类 AI 安全相关言论时,先判断其是否具备科学上的“可证伪性”。如果没有任何论据能够推翻该观点,那它只是主观焦虑的情绪叙事,而非严谨的安全讨论。
总结:计算架构全面重构,不同角色的行动方向
黄仁勋的核心观点,并非只聚焦芯片技术,而是将全栈协同设计奉为通用准则:单独优化某一模块,增长存在明显上限;跨层级整合设计,才能实现复利式突破。 这套逻辑,同样适用于硬件研发、产品架构与企业组织管理。
- 创业者: 智能体运算模式和传统训练集群差异巨大,务必围绕真实业务场景搭建架构,确保基础设施匹配工作负载。未来 24 个月内吃透这套逻辑的团队,将有机会打造出通用的底层平台。
- 投资人: 能耗是长期结构性瓶颈,如今市场体量足以支撑新能源产业自主发展。长期价值将向高能效推理、智能体专用基建以及能源赛道集中。企业过往的行业地位不代表未来实力,擅长第一性原理思考的团队更值得提前布局。
- 企业运营者与工程师: 沿用 60 年的传统计算范式已经被颠覆。吃透这一变革本质的团队,会完成架构的彻底重构;仅将其视作普通技术升级的团队,未来十年都将在过时的逻辑里反复踩坑。
- 行业新人: 当下是计算领域机遇最广阔的时代,全栈技术体系都在被重新定义。善于洞察变革、深度思考底层逻辑的人,将成为行业重构的主导者。
三大核心行动原则
- 全栈协同设计制胜: 单一模块优化有上限,全链路整合才能突破瓶颈;
- 运算模式决定架构: 落地开发前先理清真实计算的物理逻辑,否则一切都是盲目尝试;
- 趋势有迹可循: GPT 催生智能体,智能体终将催生集群协同。立足现有信号推演趋势,而非被动等待市场达成共识。
整个计算体系已然改变,这是六十年来,重塑行业的最佳时机。
本文编译自substack,原文作者The AI Corner
https://www.the-ai-corner.com/p/jensen-huang-stanford-cs153-playbook-2026
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.