![]()
![]()
物理AI的“ChatGPT时刻”已至,中国企业深度参与全产业链布局。
作者|王蕊
编辑|西子
2026 年春天,英伟达GTC大会完成一次根本性叙事转向——从「数字世界」全面跨向「物理世界」。
站在台上的黄仁勋不再只谈更强算力、更大模型,他把英伟达重新定义为一家“AI基础设施与AI工厂公司”,重心从“模型能力”转向“AI 如何真正进入现实世界”。
本届大会释放了3个最强信号:
“物理AI”的ChatGPT时刻已至,自动驾驶是规模化起点,通用具身智能是长期终点。
数据中心变身“Token 工厂”,核心指标从TFLOPS转向“每瓦特生成的Token数”。
中国力量从“参会者”变为“深度共建者”,覆盖了从硬件、软件到应用场景的全产业链。
在这一变化之下,黄仁勋进一步勾勒出“AI五层蛋糕”的全栈架构:加速计算 → 芯片与基础设施 → 开放模型 → 智能体 AI → 物理 AI,并表示AI必须学会理解重力、摩擦与材料特性,才能真正融入并改造现实世界。
对应这一框架,英伟达的发布也不再是单一芯片,而是一整套AI基础设施:新一代数据中心平台与加速计算架构,面向推理优化的软件体系(如 TensorRT),以及围绕自动驾驶与机器人的开发与仿真平台(DRIVE、Isaac、Omniverse),打通训练 — 推理、云端 — 端侧完整闭环。
这一切的底层逻辑,是黄仁勋提出的“Token工厂”经济学。
他认为,未来的数据中心将不再是存储中心,而是生产智能Token的工厂,企业的核心竞争力将取决于“每瓦特生成的Token数”。
基于此,他将2025至2027年AI基础设施的潜在市场规模预测,从5000亿美元大幅上调至1万亿美元。未来的AI服务也将像电力一样分层,从免费到超级服务,价格覆盖每百万Token几美元到上百美元的广阔区间。
而在本届大会上,尤为引人注目的是,中国力量在此次生态革命中扮演了前所未有的深度共建者角色。这不再仅是几家明星企业的亮相,而是一次从硬件、软件到应用场景的全产业链集体登场。
![]()
联想集团与英伟达联合发布新一代混合AI解决方案;
智元机器人作为Project GR00T N系列全球首批生态伙伴,展示其精密操作能力;
在核心供应链上,速腾聚创的数字化激光雷达、禾赛科技的车规级感知方案,以及领益智造(立敏达)的液冷核心部件,开始进入自动驾驶与算力基础设施体系。
在应用侧,比亚迪、吉利、小马智行、文远知行等集体入驻Robotaxi Ready平台;
而在具身智能方向,宇树科技、银河通用机器人等公司,则围绕仿真与模型探索工业化路径。
这些路径看起来各不相同,但指向的是同一个问题:AI的终极价值,取决于能否安全、高效、低成本地融入并改造物理世界。这场“肉身”革命的实现,需要全球芯片、算法、硬件、系统、终端的空前协同。
![]()
然而,从宏伟的生态蓝图到可靠的商业产品,中间还存在着真实的鸿沟:数据从哪里来?系统如何在复杂环境中持续运转?以及成本如何被压缩到可以规模化部署的区间?
也正是在这些约束之下,不同公司的技术路径开始分化。有人在解决数据问题,有人在重构系统架构,也有人在试图把成本降到可接受范围。
以下,是部分一线公司在GTC 2026现场及相关活动中的观点和判断。
AI的本质是生产“智能 Token”
英伟达创始人 黄仁勋
“英伟达不再只是一家GPU公司。我们已经成为一家‘AI基础设施与AI工厂公司’。”
“数据中心正在从‘计算中心’转变为‘Token工厂’。我们的核心指标不再是单纯的算力,而是‘每瓦特生成的Token数’(tokens/watt)。”
“我们正在构建的是AI的‘五层蛋糕’:加速计算、AI基础设施、开放模型、智能体AI,以及最顶层的物理AI。”
“物理AI的‘ChatGPT时刻’已经到来。AI必须学会理解物理世界——重力、摩擦、材料特性。”
“我们将2025年至2027年AI基础设施的潜在市场规模预测,从5000亿美元上调至1万亿美元。”
“AI服务将像电力一样分层。未来会有免费、中级、高级和超级服务,价格从每百万Token几美元到上百美元不等。”
![]()
月之暗面(Kimi)创始人 杨植麟
“长文本(Long Context)不是一个噱头,它是物理 AI 的数字底座。如果你要让一个机器人去管理一座工厂,它需要处理的不是几千个 Token,而是长达数周、包含数百万个动作序列和环境反馈的‘超长上下文’。没有极长文本的处理能力,具身智能就永远无法完成长程任务。”
“未来的 AI 不再是一个全能的巨兽,而是一个个智能体集群(Agent Swarms)。大模型作为‘指挥官’,负责拆解目标,并动态调用成百上千个专业的子代理。这种多智能体协作产生的涌现效应,将远超单一模型的能力极限。”
![]()
具身智能,死磕“物理常识”
宇树科技创始人、CEO兼CTO 王兴兴
“具身智能真正的 ChatGPT 时刻,我个人的判断是 ‘80/80 准则’:即当机器人能在 80% 的陌生场景中,仅通过简单的语音或文字指令,就能顺利完成大约 80% 的任务时,这个行业就彻底爆发了。”
“很多人觉得运动不重要,但我始终认为运动能力是干活的先决条件。到 2026 年中,人形机器人的奔跑速度将超越人类极限,快过博尔特。这不是为了秀肌肉,而是硬件驱动电机和控制算法闭环成熟的信号。”
“未来生产力的飞跃,一定是 ‘机器人生产机器人’。我们已经开始在工厂里让机器人组装它们自己的关节,这种自我复制的闭环会把成本压到超乎想象。”
“具身智能目前最大的瓶颈并不是模型架构,而是缺乏高质量的、真实的物理交互数据。我们不能像 GPT 训练文本模型那样,直接从互联网上‘抓取’机器人的动作逻辑。每一比特有效的动作数据,现在都需要通过昂贵的遥操作或复杂的仿真合成去获取。”
“Sim-to-Real 的鸿沟依然是一块极其难啃的硬骨头。在虚拟环境里表现完美的算法,到了现实世界中,可能仅仅因为地面摩擦力的 1% 波动,或者光影的一个细微闪烁,就导致整个动作序列的彻底崩溃。这种‘物理精度’的丢失,是量产落地的最大障碍。”
"机器人、AI、具身智能,都不是一两家公司,甚至也不是一个国家就能独自完成的事。无论最后是谁率先做成,对整个行业都是好事。"
至简动力CEO 贾鹏
"当前具身智能行业面临一个现实鸿沟:具身智能通用能力的不足与用户高要求之间存在巨大差距。真实世界的复杂程度远远超出想象,目前模型泛化能力较差,在大多数场景均难以落地,尤其在灵巧操作任务上几乎无泛化能力可言。"
"在工厂等应用场景中,只有达到100%的成功率才能形成真正的生产力,产生用户价值。通用能力的不足与用户的高要求之间存在着巨大鸿沟,这也是具身智能发展至今仍未大规模落地的真正原因。"
银河通用机器人创始人兼CTO 王鹤
"我们不追求机器人会做100件事,而是让它把10件事做到工业级标准。"
"仿真是我们的核心能力。我们与Isaac Sim的合作展示了一条掌握复杂机器人技能(如全身控制与灵巧操作)的确定性路径。"
![]()
思摩尔国际创始人、董事长兼CEO 陈志平
"过去,操作复杂的工业设备需要经验丰富的专家,就像专业摄影师才能拍出好照片。今天,AI正在为工业带来一场‘智能手机革命’,让毫无专业技能的普通人,也能轻松驾驭强大的生产力工具。我们的核心理念,就是‘让工业设备,更智能、更简单’。"
"未来的工业形态将是‘软件定义制造’的时代,AI基础设施服务商与工业装备厂商将深度协同、生态共生。这一格局将催生出工业界的‘龙虾+Manus’标杆体系:以通用大模型作为认知大脑,通过一个标准化、智能化的中间层,去统一连接、调度和操控物理世界里海量的工业设备,最终打通数字世界与物理世界的隔阂。"
理想汽车基座模型负责人 詹锟
"当我们把视觉、语言和行动统一到一个模型中时,它已不再只是自动驾驶模型,而是在逐渐演化为面向物理世界的通用智能体。基于同一套VLA模型,不仅可以控制车辆,也能够扩展到机器人。因此,自动驾驶只是物理AI的起点,未来这类基础模型将驱动新的具身智能范式。"
吉利汽车集团CTO 李传海
"汽车行业正处在从‘功能叠加’迈向‘体验融合’的关键节点,而核心抓手就是‘AI车’。AI不再是某个功能的‘锦上添花’,而是贯穿研发到制造、从云端到车端的‘血液’。"
"未来的AI Agent不应仅是响应指令的秘书,而应成为能基于实时场景、历史习惯进行主动服务的伙伴。例如,Eva能够学习用户习惯,在检测到驾驶员长途驾驶后出现疲惫迹象时,主动建议切换至更保守的辅助驾驶模式,并调节车内环境。这标志着车载智能从‘功能模块’时代,正式迈入‘整车智能中枢’时代。"
元戎启行CTO 曹通易
“数据闭环的挑战在于‘长尾数据的清洗效率’。我们现在的系统能从每天 PB 级的数据中自动识别并提取最具训练价值的 0.01% 极端场景。”
“未来的竞争是算力效率的博弈。如果你需要堆三块芯片才能跑赢别人的单块芯片,那么你的商业化成本结构就已经输了。”
"2025年,我国搭载城市NOA功能的乘用车累计销量超300万辆,渗透率超15%。城区NOA功能进一步普及的同时,这一技术从‘可用’向‘好用’‘敢用’跨越的挑战也正浮出水面。"
![]()
英伟达全球副总裁 吴新宙
“迈向 L4 之路,技术已经不再是唯一的变量。我们现在的重点是如何打造一个‘可规模化、高安全冗余’的自动驾驶工厂。当模型具备了泛化能力,量产的成本曲线将迎来剧烈的向下拐点。”
卓驭科技AI CTO 陈晓智
“我们正在跨越从‘感知世界’到**‘理解世界逻辑’的鸿沟。多模态端到端世界模型的核心价值在于,它赋予了汽车一种‘物理直觉’**,让智驾系统能像人类驾驶员一样,在未见过的复杂场景中进行逻辑推理。”
“智驾的下一场革命是‘语义级避障’。系统不仅要知道那是一个物体,还要知道‘那是一个飞走的塑料袋’和‘那是一个横穿的行人’在物理反馈上的本质区别。”
火山引擎智能座舱负责人 陈婧文
“大模型进入座舱不是为了增加几个语音指令,而是要实现‘从被动响应到主动理解’的跨越。真正的智能不是你喊它,而是它通过座舱传感器感知到你的疲劳或焦虑,并在你开口前给出反馈。”
“未来的核心架构一定是‘云端联动本地’(Cloud-to-Edge)。云端负责极其复杂的意图拆解和知识检索,而本地 NPU 负责对隐私敏感、高实时性的交互指令。‘全本地化推理’是保护车主隐私的最后一道防线。”
![]()
阿里巴巴智能座舱负责人 胡晓露
“我们认为,下一代座舱交互引擎必须是‘原生全模态(Native Omni)’。这意味着 AI 不再是把语音转成文字再理解,而是直接处理原始的音频流、视觉流。‘零延迟的感官对齐’是消除人机沟通‘电子味’的关键。”
“智驾大模型和座舱大模型不应该有两个‘大脑’。Qwen3-Omni 尝试做的是语义空间的大一统——当车看到障碍物时,它对物理世界的理解应该能直接同步给座舱助理,实现真正的‘所见即所言’。”
中科创达AI CTO 段崇智
“目前的端到端模型依然面临‘理解力’瓶颈。我们提出的‘多模态端到端世界模型’,本质上是给 AI 装上一个物理常识库。它让系统具备了‘想象未来’的能力,而不仅仅是根据历史数据做概率预测。”
“‘感知与规控的强耦合’是不可逆的趋势。 只有当感知模型本身就带有‘世界常识’,规控才能做出超越规则的预判决策。”
黑芝麻智能CTO 顾强
“端到端架构的演进正在倒逼芯片设计发生质变。传统的加速逻辑已经不够用了,我们需要的是针对‘大模型推理延迟’进行深度优化的新一代总线架构。”
“智能融合的下半场是‘跨域的高效流动’。如何让智驾数据和座舱数据在同一个芯片平台上低损耗地共享内存?这不仅是软件问题,更是底层半导体结构的‘效率博弈’。”
最真诚的智能汽车报道
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.