网易首页 > 网易号 > 正文 申请入驻

“大脑在硅谷,身体全靠中国!”机器人泰斗揭秘真相:后空翻只是杂耍,端起咖啡才是真AI

0
分享至

大模型能靠 Prompt 纠错,机器人不行。

编译 | 王启隆

出品丨奇点折射(ID:rgznai100)

在社交网络上,人形机器人似乎已经无所不能——后空翻、跑酷、跳舞、流水线搬运。但在顶级学术界和产业前沿,大家却在死磕一个看似极度反常识的难题:为什么一台能完成后空翻的顶级机器人,往往连把一把锅铲放进抽屉都做不好?

在最新一期 The Peterman Pod 播客中,前 Instagram 工程师 Ryan Peterman 邀请 加州大学伯克利分校(UC Berkeley)教授、Physical Intelligence( )联合创始人Sergey Levine展开了一场长达一小时的深度长谈。

这场对话触及了不少行业最敏感的焦点:人形机器人真的迎来了“GPT-4 时刻”吗?曾经惊艳全球的波士顿动力为何淡出学术中心?如果 OpenAI 和 Anthropic 全面入局会发生什么?以及,为什么全球机器人研发都离不开中国的硬件供应链?

Sergey Levine 作为谷歌学术引用量超过 27 万次的强化学习与机器人学泰斗,从早年在 Google 密布机械臂的“农场盲抓实验”,到后来用 7000 美元平价开源硬件掀起灵巧操作革命的 ALOHA 系统,他的研究深度影响了全球具身大模型的研发范式。


核心要点速览

  • 技术身处何处:机器人根本还没到“GPT-4 到 GPT-5”单纯靠工业级资源堆大参数的阶段;我们甚至尚未进入可预测的 Scale 曲线,全行业仍在寻找最底层的可扩展拼图。

  • 波士顿动力为何淡出焦点:经典控制负责调控机器人自身的机械躯体(比如后空翻),而现代 AI 负责理解和应对机体之外的大千世界(比如稳稳端起一杯热咖啡)。

  • 智能涌现的惊人真相:真正的智能跃升往往体现在失误上——当机械臂不小心打碎盘子,它会自己把底座挪过去死死挡住碎瓷片,假装一切都没发生并得出“任务结束”的结论,与人类小孩耍小聪明如出一辙。

  • 对中国制造生态的客观评价:机器人绝不是“在硅谷写好软件、其余全部外包”就能解决的。全球学术界目前极度依赖中国高可靠、低成本的精密硬件,软硬件供应链是一个不可割裂的工业整体。

  • 最致命的潜在败因:大模型回答不好,人类可以多轮修改 Prompt;但机器人的核心价值全在“彻底脱手”。只要每一步还需要人类监督,它就失去了意义,跨越最后 5% 工业级鲁棒性的门槛远比纯软件残酷得多。

以下为本次对话完整实录:

我们还没到拼算力的阶段

主持人:大语言模型带来了前所未有的产业冲击与投资热潮,而物理 AI(Physical AI)和人形机器人未来的规模甚至可能更加庞大。所以今天我想先请教你:人形机器人技术目前究竟走到了哪一步?在你的预想中,这项技术究竟会以怎样的方式真正部署到现实世界中?

Sergey Levine:回顾过去几年,或者说过去十年,我们在机器学习领域学到的最核心经验就是:只要把规模做大(Scale),它就能起效。这在今天看来显而易见,但过去并非一直如此。不过这里有一个前提:你必须在正确的方向上做 Scale。

最初大家探索语言模型时,主流架构是 LSTM。可能现在有人记得它。LSTM 表现还可以,比更早的方法强得多,但它的可扩展性(Scalability)不够好。后来 Transformer 带来的真正变革,并非因为它在数学上多么优雅,纯粹是因为它更容易扩展。面对海量数据和庞大参数量时,它更容易训练。因此,技术演进通常是分阶段的。

首先,你得找出哪些东西是具备可扩展性的,也就是确定什么是真正的“可扩展技术”。接着,你需要倾注工业级规模的资源,疯狂注入数据、做大模型参数。就在这一刻,奇迹才会发生。

因此,当我们从事底层核心技术研发时,关键在于找准那些能够被放大的杠杆。设计好架构,调配好大致的数据配比,这本身就能做出很酷的成果。但这还不足以改变世界;只有当你真正开始用力拉动这个可扩展的杠杆时,质变才会到来。

回想大语言模型的发展,当第一批 GPT 模型(如 GPT-2)问世时,它能做一些事情,但更像是一种客厅里的杂耍小把戏——你可以让它编一段关于秘鲁独角兽的故事,英文很通顺,但它根本解决不了现实世界中的复杂问题。

然而,从事该项研究的研究人员敏锐地意识到:这里正在发生某种奇妙的质变。随着数据量增加、模型体量变大,输出的内容变得越来越连贯、越来越有效。他们预见到,只要沿着这个方向大幅加码,模型就会变得无比强大。

回到你的问题。我认为机器人技术目前还没有进入“GPT-4 到 GPT-5”那种依靠工业级资源单纯做大模型参数、压榨出更多能力的阶段。

我们目前仍处于奠定底层基础技术的阶段。正因如此,大家现阶段不应期望看到模型每个月都沿着某种可预测的 Scale 曲线变得更大、更强。实际情况是:随着我们不断开发出正确的底层技术,Scaling 规律本身的特性也在同步演化。

结合现实情况来说:我对我们 Physical Intelligence 目前展示的技术 Demo 非常满意,我也觉得同行们拿出的很多成果相当惊艳。但客观看待的话,我们不应该把这些演示当成展现 Scale 规模威力的终极产物,而应将它们视为正在成型的底层基础技术,后续的规模化扩张将在此基础上建立。

我认为我们现在正在把所有零散的拼图逐步拼凑到位,而且距离拼完已经非常接近了。许多拼图碎片正在严丝合缝地归位。之所以目前很难准确预言这项技术未来的具体发展走势,正是因为我们尚未进入那个稳定、可预测的 Scale 阶段;我们正处于摸索和拼凑核心技术拼图的时期。这本身令人无比兴奋,但也意味着我们很难精确预估未来的增长系数究竟会有多大。

机器人的涌现时刻:当它开始像小孩一样「耍小聪明」

主持人:到目前为止,你见过的最令人惊讶的涌现能力(Emergent Capabilities)是什么?

Sergey Levine:这正是研究中最有趣的部分。随着技术推进,我们确实看到了越来越多的涌现现象。在最早期,出现的往往是一些微不足道的小细节,但即便如此也让人觉得不可思议——因为在 2024 年之前的机器人领域,这类事情根本从未发生过。

比如大约两年前,我们看到过这样的小插曲:我们训练了一个折衣服的模型策略,机械臂会从洗衣篮里单件抓取衬衫并尝试折叠。我清晰记得在 2024 年底的一次评测中,机械臂一下子从篮子里同时抓出了两件衬衫。我当时看着屏幕心想:“完了,肯定搞砸了,这绝对处理不了。”

结果它把两件衬衫平放在桌上,将它们慢慢抖开理顺,把其中一件放回篮子,然后开始折叠剩下的一件。当时的感觉就是:“哇,居然能做到这一步。”事后做点溯源排查,你或许能在训练数据里找到它学到这种行为的蛛丝马迹。但在测试现场,我相信没有任何一个旁观者能预料到机器人会做出这种反应。虽然是件小事,但它展现出了人类才会具备的常识。

不过坦白说,最近更让我感兴趣的其实是机器人犯的一些错误。大语言模型有一点非常神奇:一旦模型能力跨过某个阈值,它甚至连犯错都显得合情合理,不再是那种通篇输出胡话(比如一直打印 zzz)的荒谬错误,而是语义上说得通的失误。

去年我们对 模型做过一次厨房清理评测。我们给机器人的指令是“把所有餐具收纳好”,台面上放着勺子、锅铲等工具。机器人试图拉开它认为放餐具的抽屉,但抽屉卡住了打不开;于是它挪到旁边,一把拉开紧挨着的烤箱门,开始把餐具往烤箱里塞。

你可以想象,如果让一个人类小孩去收拾房间,他可能也会这么干——因为烤箱也是个容器,东西塞进去关上门就看不见了。

我们还做过另一个洗盘子的实验:机器人需要拿起脏盘子,用海绵清洗,然后放到沥水架上。这是一个考察记忆能力的实验,它必须追踪全局进度,并在内部备忘区(Scratchpad)记录:“我一共有三个盘子,灰色的洗过了,绿色的洗过了……”

结果中途它不小心把一个盘子摔在了地上,接着它把底座移动过去,刚好挡住地上的碎盘子,假装一切都没发生,然后得出结论:“灰色盘子已洗完,任务结束。”

显然,这些都不是我们希望看到的最终行为。但有趣的是,这些错误与人类小孩在试图完成任务时耍的小聪明如出一辙。

现在的它,只是还需要慢慢长大。

软硬件绝不能割裂,中国生态给全行业上了一课

主持人:你提到技术突破正在全行业遍地开花。现在有很多人在做人形机器人,比如 Figure AI、特斯拉,还有很多其他竞争对手。你具备深厚的专业知识,清楚哪些是硬骨头、哪些不是。纵观这些竞争对手,有没有哪项进展或成就让你觉得由衷钦佩、印象深刻?

Sergey Levine:对我而言,整个工业界最令人振奋的现象,其实是自动驾驶系统近年来的爆发式落地。

机器人研究者经常面临一种批评:“你们搞的东西就像可控核聚变——永远属于未来,也永远停留在未来。”但当年人们对自动驾驶也是这么评价的。而今天在旧金山,你走出大门就可以打一辆 Waymo 无人车,它真真切切能把你安全送到目的地,主驾驶位上空无一人。

抛开过多的技术细节不谈,这件事情最鼓舞人心的地方在于它提供了一个铁证:那些曾经看似遥不可及的未来技术,是完全可以真正落地的。自动驾驶在 2020 年代中期的成熟绝非偶然,因为大规模机器学习的各项关键拼图已经发展到了能够与真实物理系统有机结合的水平。

当然,车辆驾驶与机械臂操作之间存在巨大差异。但它雄辩地证明了一点:基于学习的方法确实可以在复杂的物理世界中成功扎根。这给了我极大的信心。

主持人:如果 OpenAI 或 Anthropic 开始大规模重注机器人领域,你认为这会对整个行业产生怎样的影响?竞争对手们会感到担忧吗?

Sergey Levine:平心而论,机器人领域的产业生态一直没有机器学习其他领域那么健康。

为什么这么说?因为计算机视觉和自然语言处理天然适合构建基于机器学习的繁荣生态:互联网上有海量开源免费的数据,全行业对“使用学习算法”达成了普遍共识,而且几乎没有严苛的物理安全顾虑。大家确实理所应当地关注 AI 安全,但这与实体机械造成人身物理伤害完全是两码事。正因如此,在那些领域搭建大规模机器学习工程要容易得多。

机器人领域则大相径庭。传统机器人学一直缺乏共享数据的文化氛围。

因此我认为,在学习算法与机器人结合的赛道上,参与者越多,就越能推动整个行业的思维范式转变。让大家真正接受:未来的机器人必将由学习模型驱动,而非手工编写的控制器;数据至关重要,且数据必须共享——因为没有任何单家公司能在单一垂直领域内打造出真正的通用基础模型。

这种转变会引导整个机器人行业向视觉和 NLP 的研发生态看齐,彻底告别传统的工业自动化思路。从这个意义上说,尽管我对 Physical Intelligence 目前的工作深感自豪,但要彻底扭转全行业的思维定式,单靠一两家公司的力量是远远不够的。

主持人:作为一个局外观察者,我经常在 Twitter 上刷到中国机器人的各种惊艳演示。某种程度上甚至感觉他们已经走在了前面。但我没有深厚的行业背景,我很想听听你对中国机器人发展的看法:他们真的更领先吗?

Sergey Levine:对于我们这些在美国和欧洲从事这项技术研发的人来说,最有用、最具建设性的做法是思考:我们能从中吸取什么经验?

对我而言,最核心的一条经验是:拥有一个健康的完整生态至关重要。

所谓生态,不仅意味着要有一流的研究员和顶尖的工程师,意味着繁荣的开源社区;更意味着支撑机器人产业的各个关联工业门类自身都必须极度健全。这绝不仅仅是计算机科学、机器学习和模型训练的事,它还涵盖了供应链、硬件制造能力以及底层的工程研发。

在这些要素中,有些方面美国做得很出色,但另一些方面美国却有所松懈和掉队。

我们应当客观审视全球格局,正视中国实验室以及其他国家实验室取得的卓越成就。我们应当汲取的教训是:必须全力去构建一个更健康的本土产业生态。这意味着要对构成这个体系的每一个环节进行全方位投入。

我不是商业精英,也不是投资专家,不敢妄言具体该如何操作;但我深信我们必须建立全局观念:这是一个不可分割的有机整体,绝不能只做其中一环,而把其余全部外包出去。

主持人:在整个生态拼图中,作为美国本土的机器人学者,你觉得哪一部分如果能得到改善,对推动机器人技术发展的效果最显著?

Sergey Levine:毫无疑问,获取高可靠性、低成本硬件的便利程度是重中之重。

当下用于机器人学术研究的很多硬件确实产自中国。它们品质优秀、价格相对亲民、制造精良,完全能满足大众的通用标准。但如果能在美国本土同样便捷地采购到这些全套硬件,那将带来巨大的助力。这并非不可实现,关键在于我们必须清醒认识到:需要扶持的是整个工业制造生态,而非单一孤立的软件环节。

别把杂耍当泛化,突围的时间表是「个位数年份」

主持人:很多人设想,谁率先实现规模化,谁就能最先突围。这里可能会出现一种指数级增长效应:一旦完成部署,部署有助于更快扩张,而扩张又反哺进一步部署,形成数据飞轮。你是否认同这个行业会出现某种突围拐点,让中美某一家实验室彻底甩开其他所有人?

Sergey Levine:这种说法有很大合理性,但必须注意一个至关重要的前提细节:你扩展的方向必须正确。

我更倾向于把这种机制表述为一种良性的正反馈闭环:部署的机器人越多,模型的泛化能力就越强。这确实是核心所在,逻辑完全成立。但陷阱在于:把这件事情做歪的方式实在太多了。

举几个显而易见的误区。假设我是一家汽车制造商,我的机械臂在流水线上每天焊接汽车,一个月能完成上百万次焊接。如果我仅仅把这些当成数据飞轮,我最终训练出来的模型能力,大概率永远无法超越一台单纯焊汽车的机械臂。因为这台机器人本来就会焊接,反复记录相似动作所带来的边际提升微乎其微。

这个例子说明了找对 Scaling 方向的重要性。数据并不具备完全的同质替代性,它不像电力或石油,花钱买更多就能直接用;数据必须具备高度的异构性与多样性。

因此,正反馈飞轮的逻辑是对的,但前提是必须依托正确的模型技术,汲取多样化的学习源。数据对机器人而言,更像是一套全方位的通识教育体系,而不是一种标准化的工业大宗商品。

主持人:如果着眼于构建这种数据飞轮,打造一个能产生有效数据并反哺系统进化的成熟平台,你预计大概什么时间能在现实世界中真正跑通?

Sergey Levine:从技术演进的角度来看,我们正以极快的速度向这个目标逼近。

决定具体时间表的一个关键平衡点,在于系统开发者愿意在多大程度上引入结构化约束。

一种极端是直接跨越到完全非结构化的开放场景,比如家庭服务机器人。这固然令人兴奋,因为一开始就能获得极高的数据多样性;但门槛也高得多——系统必须足够高效,更要保证绝对安全。家庭场景涉及与普通人的近距离接触,安全挑战极其严峻。

另一个极端是聚焦于高度结构化的场景,虽然不至于退回到固定焊接臂那么单调,但可以是走廊巡检、搬运等轻度非结构化任务。这类场景落地容易得多,周围是受过培训的人员,任务可预测性强,安全顾虑小;但缺点是每条新采集数据的边际价值较低,因为场景缺乏足够的变化。

换句话说:你可以选择起步更早,但能力的爬升斜率较低;或者起步稍晚,但后续的爆发斜率更陡峭。每个人都需要在这两者之间权衡校准。

但我个人的预判是:无论走哪条路线,真正实现落地突破所需的时间都是个位数年份(Single-digit years),绝不需要数十年之久。高度结构化或半结构化的场景可能就是今明两年发生的事情;非结构化程度更高的复杂场景可能还要再等几年,但绝不会拖上十年。

主持人:很多人喜欢讨论模糊的时间线。如果让你勾勒一份里程碑式的路线图——不用过于教条,但足以指引我们走向“家庭机器人”这个终极北极星目标——它会是什么样子?

Sergey Levine:这是个非常棒的问题。在回答之前我想先说明一点:在铺天盖地的行业炒作和酷炫 Demo 中,大众极易忽略一个本质事实——机器人领域永恒的核心难题始终是“泛化能力”(Generalization)。

但当一家机构展示系统演示时,单凭一段视频通常根本看不出它究竟达到了何种程度的泛化水平。

比如那些高难度的杂技动作演示,视觉冲击力极强。但如果那是一个经过精心编排、甚至带有舞台表演性质的测试,那它本质上就是一场排练好的演出。这当然无可厚非,但在一场特定秀场中成功表演,与在任何普通家庭里每一次都能稳定可靠地完成任务,完全是两码事。

当脱离了具体统计学背景时,真正的泛化往往看起来其貌不扬。因为泛化是一组跨越多次测试的统计学属性,绝不是单次表演的灵光一现。

你可能会看到机器人做着一件平淡无奇甚至略显笨拙的小事,但其真正激动人心之处在于:它面对的是从未见过的物体,身处从未测试过的全新环境。这实际上比把一个后空翻动作在固定场景下死记硬背训练数百万次要困难得多。

明确了这一点,我对路线图的看法是:整张路线图的核心,一方面在于达成更出色的泛化能力,另一方面在于构建一种“在泛化过程中自我汲取更多泛化能力”的二阶进化机制。

路线图上的关键里程碑包括:

第一步:必须拿出极具说服力的具体实例,证明机器人系统能够在最初未受训的新环境中,通过自主积累的实际经验实现自我强化。

无论在实验室后台做过什么模型训练或自适应算法,当我把它丢进一个全新场景(比如一个新家庭或新车间)去处理实际事务时,它一开始的表现或许中规中矩;但随着时间推移,它必须能自主进化得越来越好,直至达到工业实用的鲁棒性水平,而不是表现卡在 50% 的成功率就停滞不前。

这将是一个重大的历史节点。因为这意味着整个流程真正实现了自动化自进化:它一边帮人类解决实际需求,一边自主采集高价值经验,反哺自身模型。一旦突破这一步,我们就可以将模型部署到千万个不同领域,让它在服务用户的同时自我迭代。

第二步:展示出一种切实可行且具备实用价值的知识迁移机制,实现常识(Common Sense)的迁移以构建系统的终极鲁棒性。

这是我们在常规训练中很难穷尽的场景。例如你在路上开车,前方突然出现一辆消防车和一排路障;即便你此前从未遇见过一模一样的路况,你的常识也会告诉你:“应该减速,哪怕不知道最优反应是什么,也绝不能直接冲撞路障、妨碍消防员工作。”

这就是常识。如果机器人能将这种常识灵活应用于意外状况的纠错中——比如当它误把锅铲塞进烤箱后,能凭借常识意识到“这不合常理”,并主动打开烤箱把锅铲拿出来重新归位。

这同样是至关重要的一步,因为它证明了我们能够借助常识来自动修复现实中的未知错误。

主持人:按你的逻辑,如果一款人形机器人只被限定在流水线上的某一个特定制造工位,你似乎对这种应用方向并不太感冒,因为这并不算通向通用智能的真正阶梯?

Sergey Levine:我不该说对此缺乏兴趣,而是我认为真实物理世界中充满了各种“漏洞百出的抽象层”(Leaky Abstractions),导致这种看似封闭的任务远比表面看起来要复杂得多。

打个比方:在 1990 年代人们全力投入自动驾驶研发时,曾有一种流行思路,认为只要对外部环境做一些规范化改造,就能规避掉大部分技术难点。比如在公路上预埋磁感应线圈,在车上安装传感器和发射器,让车辆彼此感知位置——就像飞机的空中交通管制一样。

当时有人觉得,这样根本不需要什么复杂的 AI,靠传感器铺装就能解决问题。但这种方案最终彻底折戟。因为真实世界存在太多不可预测的异常与极端工况:即便 99% 的情况下磁感应方案完美运行,剩下 1% 遇到行人横穿公路或路面掉落杂物时,整个系统就会彻底瘫痪。

最终走通的道路,是 Waymo 这种不回避硬骨头的路线:他们没有选择在空旷无人的试验场绕圈子,而是直接把车开进环境极其杂乱的旧金山市区,正面迎击所有混乱场景。这促成了整个自动驾驶社区的技术蜕变。

机械臂操作也是完全相同的逻辑。一旦跨出工厂绝对结构化的温室,哪怕只向外迈出一小步,即便 99% 的场景按部就班,那 1% 的突发意外也迫使你必须具备解决全局通用问题的完整能力。

主持人:这让我想起 Figure AI 之前做过的一场直播:他们连续数小时直播机器人分拣包裹。在你看来,那场演示展现出泛化能力了吗?

Sergey Levine:我认为是的。顺便提一句,这也是让我感到非常欣慰的趋势:正如我前面所说,单靠一段短视频很难展现真正的泛化能力,现在显然有很多人在深入思考如何直观呈现泛化水平。

你可以看到很多极具创意的展示方式:连续不间断的现场直播、超长时间的延时摄影记录等等。我认为这是非常棒的方向,有助于在公众意识中提升对泛化能力的重视程度。

去年底我们团队推进强化学习项目 时,也希望做一些超长程任务实验。我们曾在 Dandelion 巧克力工厂让机械臂连续数天执行折叠包装盒的任务,毕竟那是真正的巧克力工厂,真实需要大量包装盒。

但我们还做了一个制作咖啡的实验:让机器人操作一台意式浓缩咖啡机萃取咖啡。我们让它连续运行了 13 个小时。我们尽量追求环保,不想浪费咖啡豆,这就导致那 13 个小时里办公室里的每个人都精神极度亢奋,因为做出来的咖啡总得有人喝掉。

整整 13 个小时,整体效果非常棒。它中途确实搞砸过几次,比如不小心打翻了咖啡粉,但它能自己去找抹布把台面擦干净。最终没有发生任何灾难性故障,13 个小时平稳收官。唯一的负面影响大概是大家摄入了过量咖啡因导致失眠。

主持人:等等,当它打翻咖啡粉并自己清理干净时,整个过程是完全自主完成的吗?

Sergey Levine:在这个实验的底层架构中,存在一个高层级的提示指令层(High-level Prompting)。大概每隔五分钟,在上一个语义完整的阶段任务结束时,高层指令会做一次更新。

比如人类会下发宏观指令:“制作一杯意式浓缩”、“清理咖啡机台面”等等。在这个实验里,去拿抹布清理台面的宏观动作是由人类下达触发的。原则上我们可以把这个环节也全部自动化,事实上我们目前正投入巨大精力改进负责下发高阶决策指令的通用策略模型。

但在那个特定的长程测试里,每隔五分钟由操作员按现实生活逻辑更新一次目标,就像你在真实咖啡馆点单一样:“我要一杯拿铁,再来一杯浓缩。”我们只是多下达了一句:“在做下一杯之前,先把台面清理干净。”

先建立物理世界的锚点,再去向人类视频偷师

主持人:听起来在通往泛化的道路上,数据起着决定性作用。目前行业里存在各种数据来源:仿真合成数据、真实物理交互数据等等。我很想听听你的判断:哪些数据是最高效的?哪些价值最低?各自的优缺点是什么?

Sergey Levine:在当前的机器人学术界,这是一个讨论极为热烈、甚至派系观点针锋相对的核心议题。

我个人的核心观点是:如果模型能够建立在对物理世界的坚实理解之上,它吸收和内化各种异构数据源的效率就会高得多。

让我举几个例子来说明:

如果你想学习开飞机,训练过程中大概率会用到飞行模拟器。模拟器之所以对你有用,是因为你在坐进模拟舱之前,大脑里已经具备了海量的物理常识来锚定眼前发生的一切。你心里清楚自己不是在打电子游戏,而是在习得将要在真机上使用的操作映射,你能理解其中的抽象关系。

同理,即便你在玩一款画面极为粗糙简陋的像素游戏,你也能自发将屏幕上的符号与过往的人生经验联系起来,在脑海中完成类比映射。

尽管仿真环境只是对现实世界的粗糙近似,但人类之所以能轻松理解它,是因为我们自带强大的先验经验,能够自动脑补并填平仿真模型留下的所有空白。

再比如观察他人学习:你看别人做饭,哪怕你无法切身体会对方每一块肌肉的收缩力度,你也能凭借过往的生活经验看懂全貌。你会想:“他在拿盐罐撒盐,我也撒过盐,所以我明白他在干什么。”你可以在“加盐”这个抽象认知层面上吸收这条经验,而不需要费力去解析对方肌肉运动的底层轨迹。

我想表达的核心是:一旦你对“如何用身体在物理世界中进行交互”建立起基础认知,所有其他渠道的知识就都可以顺畅地挂载到这套认知底座上。过往经验为你提供了一个稳固的参照锚点。

由此推论:如果我们拥有一个在海量真实具身物理数据上训练出来的机器人基础模型,它就具备了这种底层的物理锚定能力,进而能够以高得多的效率去吸收和内化其他形态的外部知识。

这种逻辑其实与很多人的直觉恰恰相反。看到大语言模型利用互联网海量文本取得成功后,很多人很容易产生一种诱人的想法:“我们何不反其道而行之?先用海量的 YouTube 人类视频预训练,然后再往上叠加少量的机器人数据。”

但我认为正确的路径恰恰相反,而且我们已经掌握了支持这一论点的实验证据。

我的同事 Suraj Nair 与佐治亚理工学院的 Simar 此前做过一个联合研究项目:他们拿我们的机器人基础模型去融合人类视频数据。但他们并没有以人类视频为起点,而是先在一个基于真实机器人数据训练的基础模型上,再叠加人类视频进行微调。

他们深入分析了模型内部的特征表征机制,对比模型究竟是如何表征“人类行为”与“机器人行为”的。

结果发现:如果使用参数量较小、机器人训练数据量较少的底座,模型内部对人类经验与机器人经验的表征会呈现出截然分开的状态,特征空间完全割裂。

但是,当你使用来自多种不同机器人的海量数据充分预训练底座之后,模型内部的特征聚类方式彻底变了——它不再根据“操作者是人还是机械臂”来进行特征划分,而是高度纯粹地按照“正在执行什么任务”来进行表征归类。

当我们看到 t-SNE 特征降维可视化图谱时,所有人感到无比震撼:当机器人训练数据量拉满到 100% 时,两者的特征分布完全重合。特征嵌入的形状完全由任务的本体语义决定,对执行者的身体构型差异几乎完全脱敏。

这太不可思议了。因为基础模型在最开始根本没有见过任何人类视频数据,但后续只要接入人类数据,它就能以完全一致的物理表征空间去无缝兼容。

这是极具说服力的证据:拥有扎实的机器人原生经验作为基石,不仅能稳稳承载其他维度的知识,而且吸收效率要高得多。

主持人:那么这个基础模型在训练时,是否必须包含特定机械臂电机和特定关节构型的数据?

Sergey Levine:到目前为止,我们在能够适配多种不同构型的跨本体模型(Cross-embodiment Models)上倾注了大量心血。但坦白讲,通常情况下,为了获得出色的最终性能,你确实需要采集一些目标部署构型的真实数据。

因此,现阶段衡量跨构型泛化能力的核心指标,并不是“完全零样本(Zero-shot)直接驱动一台从未见过的全新机器人”,而是“能否用极少的目标机器人样本,成功迁移复用其他机器人身上学到的海量技能”。

这就是当下的行业现状。不过这里有一个令人惊喜的积极发现:尽管需要目标本体的数据,但模型为了适配不同硬件所需做出的特殊架构设计其实非常少。

刚开始做跨本体研究时,我脑子里列过一张长长的酷炫研究清单,想着怎么去精细化适配不同形态:比如设计模块化的模型表征,分拆出一个 6 自由度机械臂头、一个 7 自由度机械臂头、一个夹爪控制头等等。

最后我们把这些繁文缛节全部抛弃了。现在的模型直接输出一个大维度的统一数值向量;如果某台机器人的自由度较少,就在剩余维度直接补零(Zero-padding),没有任何花哨的处理。模型直接吞入所有构型的数据进行联合训练,纯粹基于摄像头看到的画面输出正确的动作控制量。

回到你刚才关于新硬件适配的问题。

目前我们重点攻关并已初见成效的方向,是机器人之间的技能迁移(Skill Transfer)。在这个环节,模型的具体推理机制设计至关重要。

例如,你可以让模型在输出底层控制动作之前,先进行某种模态的“中间思考”。这种思考可以基于文本——基于文本的推理非常适合迁移高层级的行为逻辑框架。

比如它能帮你理解语义常识:“如果要收拾厨房并收纳餐具,首先得拉开抽屉。”这种高维语义推理完全独立于机器人的具体机械构型,迁移起来非常丝滑。

但更令人兴奋的是,只要选对表征模态,低层级的物理操作技能同样可以跨硬件迁移。

我们做过一个实验:在决策流程中引入一个以“图像”为思考模态的中间生成阶段。模型会先在内部“脑补”生成一张代表任务下一阶段里程碑状态的目标图像。

借助这种机制,我们成功让一台从未采集过叠衣服数据的 UR5 机械臂顺利完成了 T 恤折叠。

因为直接让 UR5 输出底层关节轨迹极其困难——这台机械臂的关节几何构型完全不同;但是,让生成模型去“脑补出一张 UR5 折好衣服时的画面”却相对容易,因为模型见过 UR5 在各种姿态下的机身画面,也见过 T 恤在各个折叠阶段的形态,知道手爪大致应该抓在什么位置。

利用强大的生成模型预测出这张中间视觉状态后,反向推导所需的机械臂动作就变得轻而易举,直接对比图像中的机械臂姿态即可解算出关节角度。

这并没有改变问题的物理本质,而是引入了一个极其精妙的中间思维阶梯,让复杂问题瞬间降维。就像解数学题一样,只要找准了关键的中间步骤,最终答案往往呼之欲出。

这证明跨机器人的硬件泛化以及更广泛的通用泛化,完全可以像大语言模型那样通过显式“思考”来大幅增强——关键在于,你必须引导它在正确的模态(如空间视觉模态)下进行思考。

主持人:很有意思。也就是说,模型输出的中间图像是它预测摄像头下一秒应该看到的画面?

Sergey Levine:是的,你可以把它理解为一种图像生成或视频预测机制。核心在于让它在脑海中先具象化地预演任务推进后的视觉状态。这种思维机制与人类极其相似。

人类在规划行动时,有些依靠语义,有些则完全依赖空间直觉。你在攀岩时,大脑绝对不会计算“左臂向左平移 37 厘米”,你脑海中浮现的一定是手臂抓向下一块岩石的视觉画面。

机器人的死穴不是安全,而是能不能「彻底撒手不管」

主持人:访谈开始时你提到 Waymo 极具启发性,他们的工程落地证明了在现实物理世界中实现通用机器人是完全可行的。但我记得很早以前大家就承诺无人驾驶即将普及,结果实际耗费的时间比预期长得多。

对于人形机器人,是什么让你有底气给出“个位数年份”的乐观预期,而不是陷入同样的漫长长尾效应和法规泥潭?

Sergey Levine:机器人基础模型与传统自动驾驶工程系统在架构路线上有一个核心分水岭:现代基础模型的软件栈极其轻薄(Thin Stack)。

训练一个基础模型绝非易事,你需要处理海量数据、精心清洗标注,前期有大量的工程积淀。但真正部署运行在机器人机载端上的软件逻辑却精简到了极致。

它可能包含一个高层思考推理模块,再加上一个快速输出控制动作的端到端网络,对推理延迟有一定要求。但如果纯粹从底层有效代码行数的角度衡量,它比传统的自动驾驶技术栈要少上几个数量级。

传统自动驾驶项目起步极早,背负着大量在旧技术时代沉淀演化下来的复杂子系统;另一方面,自动驾驶是一个容错率为零的极端安全敏感场景。

机械臂偶尔打碎一个玻璃杯确实糟糕,但比起自动驾驶汽车撞到行人,后果的严重程度完全不可同日而语。

这绝不是说机器人的物理安全不重要。物理安全非常关键,也是整个系统中最难攻克的硬骨头之一。但在实际商业部署中,它不会像车载自动驾驶那样构成一票否决的绝对死锁——因为我们完全可以先挑选人机物理隔离、任务环境可控、使用安全硬件的场景切入。

因此,软件架构的极度精简,叠加落地初期相对宽容的安全容错空间,让机器人的工程闭环变得容易得多。再结合前面提到的正反馈飞轮效应:只要系统能在受控约束下率先进入现实世界运转,就能源源不断吞吐数据,加速后续更大规模的普及。

主持人:大家对“事后剖析”(Postmortem)很熟悉,即在失败后反思原因。如果今天我们做一次“事前剖析”(Pre-mortem):假设人形机器人未能在个位数年份内取得成功,你认为最核心的败因会是什么?

Sergey Levine:归根结底,机器人若想产生不可替代的真正价值,其可靠性、鲁棒性与泛化水准,必须跨过一个远高于我们对大语言模型或文生图/视频工具所要求的严苛门槛。

大语言模型等生成式 AI 在本质上是“以人类为核心的交互协同工具”。如果大模型第一次给出的回答不尽如人意,你可以修改 Prompt 重新提问,在多轮对话中逐步逼近理想结果。

正因如此,哪怕是初代 ChatGPT 这样相对粗糙的版本,一经推出也极具实用价值——用户愿意不断尝试调整,直到解决问题。这就像使用搜索引擎,一次搜不到就换个关键词。

但机器人完全不同。机器人的全部核心价值,完全建立在“全程脱手、自主闭环完成任务”的基础之上。如果机器人每做一个动作都需要人类在旁边实时监督纠错,那它的存在就彻底违背了帮人类解放劳动力的初衷。

因此,最大的潜在风险就在于:我们究竟能否以足够低的成本,跨越这道极高的可靠性与鲁棒性门槛?

这也是为什么有些经过精心挑选的 Demo 容易产生误导。一段开诚布公的精彩演示固然能体现技术进步,但它无法直接证明系统距离工业级的实用鲁棒性究竟还有多远。

我个人极其推崇利用强化学习(RL)技术来吞吐真实自主交互经验,以此攻克从 95% 到 100% 成功率的最后几道难关。这极为关键,且目前在学术和工业界都尚未被彻底解决。

主持人:如果最终耗费的时间超出预期,本质原因就是现实世界对可靠性的门槛要求高得多。

Sergey Levine:正是如此。尤其是通往终局的最后几步,不仅需要极致优化的模型架构,更呼唤底层算法范式的创新。

我绝不是那种主张“把现有基础模型的一切推倒重来”的虚无主义者,完全不是。我认为目前手头的各项核心拼图已经相当扎实。但我们必须清醒地承认:现有的模型与训练方法,要想彻底跨越严苛的工业级鲁棒性红线,依然需要更深入的技术突破。

主持人:在大语言模型领域,感觉所有人都在同一条主流技术路线上做不同口味的微调。在机器人行业也是全员同构吗?有没有什么另辟蹊径的先锋架构?

Sergey Levine:实际上,机器人领域的技术异构程度远比表面看起来要丰富得多。

一条最核心的分水岭——虽然单看演示视频往往很难察觉——在于:团队究竟是全盘接纳“基础模型信条”(Foundation Model Ethos),还是选择深耕特定垂直工业场景。

这一点之所以有时难以辨别,是因为在当下舆论环境中,每个人都会标榜自己“正在复制大语言模型的成功路径”,毕竟这样讲最有号召力。

但“基础模型信条”的底层哲学本质上是这样的:如果你想攻克某个特定的现实问题,最佳路径不是针对它单独开发专用系统,而是去训练一个能消化广阔任务数据的通用大模型。只要方法得当,这个通用模型在特定专业问题上的表现,反而会彻底碾压狭隘的专用系统。

再拿大语言模型打个比方:如果你想做机器翻译,不要去死磕一套专用的机器翻译流水线;你应该训练一个精通所有人类语言任务的通用大模型,然后直接把它用在翻译任务上。

在机器人领域,这种底层逻辑在现阶段会让很多资深从业者感到极度违背直觉甚至难以接受。

如果一个团队正在做仓储自动化,你跑去告诉他们:“要想做好仓库货品分拣,你应该多去收集在厨房里摆放刀叉餐具的数据。”这听起来简直像天方夜谭。

但这就是基础模型教会我们的真理:只要你的数据覆盖面足够广阔,从足够多样化的异构任务中汲取养分,模型就能沉淀出真正的通用泛化技能。只要底层模型架构得当,它就能将这些技能自如迁移到遇到的任何全新场景中。

所以我坚信,即便是打造一台仓库搬运机器人,海量多样化的泛化数据训练依然是最佳路径,它能赋予机器人应对仓库现场各种稀奇古怪极端情况的容错底气。

但要让全行业普遍接受这一点并不容易,因为它与传统垂直整合的经典机器人工程学思维是完全背道而驰的。

未来的物理智能,绝不是满大街跑着机械化的人类

主持人:我注意到 AI 领域的一个独特现象:一家企业一旦取得空前突破,就会立刻引发社会的广泛焦虑与监管介入。例如 Anthropic 推出超强模型后,政府迅速跟进,引发全社会对安全和风险的巨大讨论。你如何看待这一现象?如果 Physical Intelligence 今年拿出了能力极其惊艳的通用大模型,你会如何应对这些伴随而来的安全议题?

Sergey Levine:AI 安全并不是什么新鲜事物。我在加州大学伯克利分校的同事 Stuart Russell 早在十多年前就对此展开了深入研究,无数顶尖学者在此倾注了毕生心血。

核心痛点在于:当底层技术演进过于迅猛时,安全问题往往不再仅仅取决于纯粹的技术公理,而是演变成技术与人类社会复杂互动的产物——社会如何反馈、哪些工具被广泛采纳等等。

这些变量在事前极其难以精准预测。因此我无法给出一个一劳永逸的标准答案。

在 Physical Intelligence 内部,我们应对安全挑战的核心哲学是“彻底的经验主义实践”:把系统真正部署到真实物理世界中去运行,在受控环境中观察它在现实中会发生什么,明确哪些环节运行良好、哪些环节出现偏差。借此最真实地摸清技术的边界、优势与致命软肋。

但归根结底,你必须时刻保持敬畏与清醒,密切追踪现实反馈,并随着形势发展动态调整应对策略。很多极端情况是无法在实验室里凭空预判的。

你的提问非常切中要害。如果说全社会对仅仅局限于电脑屏幕内部的纯软件 AI 都有如此巨大的安全担忧,那么当 AI 真正拥有实体躯干、能够在物理世界中执行人类能做的一切实体操作时,大家产生的戒备与安全顾虑必然会成倍放大。

这些风险是真实存在的。唯一的正解是脚踏实地在实践中动态迭代与应对。

主持人:这是令人警惕的一面。但在乐观的愿景下:如果一切进展顺利,我们在十年后拥有了无比强大的模型与人形机器人,这是否意味着终极目标就是“人类实体劳动的终结”?

Sergey Levine:我认为把机器人简单理解为“机械化的人类”是一种认知误区。

某种程度上,计算机就像是“机械化的大脑”。但当个人电脑在 1990 年代和 2000 年代初真正爆发普及时,现实中发生的事情并不是人类直接把自己的大脑替换成电脑。

相反,我们见证了计算设备形态的极度多元化泛滥,迎来了“普适计算”(Ubiquitous Computing)时代。你的办公桌上有一台电脑,口袋里装着智能手机,甚至汽车和冰箱里都嵌入了计算芯片。由于计算能力的获取变得如此廉价便捷,计算被无缝融入了世间万物。

这绝非 1940、1950 年代计算机先驱们最初的预想——他们当年脑海中构想的,往往是一台占满整个房间、负责统筹调控整个国家政策运行的超级巨型机,绝不会想到微型芯片会塞进每个普通人的冰箱里。

同理,未来的物理 AI 可能会以各种各样的形态渗透进实体环境的方方面面。在你每天需要亲手处理的无数繁杂琐事中,随时都能获得实体智能的辅助。

另一个绝佳的参照物是现代的 coding agents。虽然关于 coding agents 终局形态的争论仍未盖棺定论,但从当下软件工程师的实际工作体验来看,绝大多数人显然认为 coding agents 极大地赋能了自己,而不是引发普遍的恐慌。诚然有人会感到焦虑,但至少从我接触的大量软件工程师以及我个人的亲身体会来看,借助 AI 工具成倍放大生产力,是一种非常踏实的赋能感。

这是一个极具参考价值的现实范例——因为这是 AI 真正切入一个成熟职业分工、并实打实为从业人员提供超强杠杆的鲜活样本。

我们可以以此为镜鉴,但未来的真实画卷仍有待时间给出答案。

波士顿动力管好了躯体,而现代 AI 必须学会应对大千世界

主持人:在大语言模型领域,有几篇公认的奠基性论文;只要读懂它们,就能清晰把握整个技术突破的历史脉络。对于渴望了解人形机器人前沿现状的初学者,有哪些你认为必读的里程碑式经典论文?

Sergey Levine:我想推荐的一篇——这里面多少带有一点夹带私货的嫌疑,因为我是共同作者之一;不过必须坦白说明,这篇论文 99.9% 的核心贡献都出自第一作者 Tony 之手——那就是最初的 ACT 论文(即 ALOHA 系统的开山论文)。

这是一个极具启发性的范例。从某种角度看,论文中提出的核心算法思想并非多么石破天惊,但它的工程呈现方式却极其优美绝伦。

它的核心理念在于:如果你搭建出一套精妙而低成本的机器人硬件平台——在论文中,Tony 使用了来自 Trossen Robotics 的开源机械臂套件,整套设备大概只要 7000 美元左右,属于业余极客级硬件——并将其组装成一套具备主从遥操作功能的双臂系统。

他雄辩地证明:无需任何晦涩复杂的控制特技,只要软硬件架构搭配得当,就能轻而易举采集到极高精度的双手遥操作示教数据,去完成过去大家认为必须依赖极其昂贵精密的硬件才能搞定的高难度灵巧操作;再配合一个相对标准的 Transformer 架构模型,就能极其出色地学会这些复杂技能。

在传统学术界,大家往往极其看重是否有深奥复杂的数学推导或晦涩的技术洞见。而在那篇如今已产生深远影响的论文中,核心洞察非常纯粹:只要把正确的拼图模块优雅地拼在一起,对“一套配备了优秀端到端学习系统的平价机器人究竟能做到什么”抱有更多坚定的信心即可。

他在论文中展示了诸如给遥控器更换电池等高难度动作,甚至找来一个假人模特的脚,展示机械臂如何精准地帮人穿上鞋子——这是一种极具现实关怀的助老助残应用。

这篇论文之所以引发整个学界的巨大震动,正是因为它证明了仅凭相对基础朴素的积木模块,究竟能走得多远。如今 Tony 已经把全套代码彻底开源,ACT 代码库成为了全球无数机器人学习研究者的入门标配。

对于任何想要踏入这个领域的人,我都极力推荐去把这篇论文彻底读透。尽管它在算法理论上并不故作深奥,但它能帮你建立起对技术本质的清晰度量:

细节决定成败,但细节本身并不一定非要复杂晦涩。

主持人:在当前由大模型主导的具身智能浪潮爆发之前,波士顿动力(Boston Dynamics)凭借极度硬核的演示视频占据了全网的绝对认知。当时哪怕是行业外的人看到,也会由衷惊叹于他们技术的不可思议。

但最近几年,他们在公众讨论中的声量似乎明显减弱了。行业内部是否发生了某种范式转移?你如何解读这种变化?

Sergey Levine:我会这样解释:从本质上讲,机器人学是一门关于“构建超复杂综合系统”的学科。

虽然人们习惯把 AI 划分为几个平行赛道——大语言模型、计算机视觉、机器人学等等,但机器人学与其他领域有着根本性的不同:做机器人必须把所有软硬件拼图完整做齐。从最底层的机身布线、能源动力配置、执行器结构设计,一路向上贯穿到高层规划决策系统,缺一不可。

当我们审视网络上琳琅满目的演示视频和创业公司时,大家虽然都顶着机器人的名头,但各自钻研的其实是系统技术栈中截然不同的生态位。

波士顿动力早期的经典成就,核心展现的是极其卓越的硬件工程设计——顶级的机械本体,配合极其聪慧的经典控制理论专家手工精调的传统控制算法;但其技术栈在当时相对弱化了通用“决策智能”(Decision-making)的权重。

在特定的历史阶段,这种工程路径是完全合理的。因为如果你连一台高动态性能的物理机身都造不出来,上面搭载多么聪明的决策大脑都无从谈起。

但正如我们前面探讨泛化能力时所言:在今天这个时间节点,虽然硬件制造依然有很大的提升空间,但在很大程度上硬件已经“足够用了”。当前最核心的瓶颈,在于如何构建一个能在现实环境中与万物展开高智商动态交互的决策感知闭环。

如何划定这其中的边界?我所说的决策闭环,并不单指高阶的符号逻辑决策,也包括底层的物理动作决策。核心判据在于:系统在行动时,究竟需要实时兼顾外部物理世界中的万千变量,还是仅仅处理机器人自身的肢体平衡?

如果你想在平地上完成一个后空翻,你本质上只需要精准调控机器人自身的动力学机体;但如果你想从桌上稳稳拿捏起一杯咖啡,虽然动作看似没有后空翻剧烈,但你必须深度理解外部世界的一举一动,而不仅仅是自己的身体。

技术演进到今天,这恰好构成了现代 AI 与经典控制理论(Controls)的核心分水岭:

经典控制负责调控机器人自身的机械躯体;而 AI 负责理解和应对机体之外的大千世界。

这解释了为什么大家今天的关注点发生了转移。如果一个动作只需要管理机身本体而无需深度感知外部环境,顶尖的经典控制算法确实能给出近乎完美的解法。

但从经典控制工程中,我们依然能汲取极其宝贵的养分:如果人类工程师能够通过手工设计控制器来实现某种极其复杂的运动行为,这本身就是一个强有力的“存在性证明”——证明该行为不仅在物理上完全可行,而且其控制规律足够精炼,连人类大脑都能推演解析。

人类大脑能处理的复杂逻辑上限其实远低于现代 AI 模型。如果一个工程师能手写出一套实现杂技动作的控制律,就证明其背后必然存在一套相对简洁优美的控制规律。既然这种简洁规律客观存在,且能够被人类手工提炼,那么将其交给端到端学习算法进行自主学习与自动化部署,就完全是一条走得通的康庄大道。

别再迷信从零白手起家,没有先验知识就是自讨苦吃

主持人:最后一个问题:如果你能穿越时空回到刚刚踏入这个行业的起点,站在今天的认知高度给当年的自己一句忠告,你会说什么?

Sergey Levine:这些年我学到的最核心的一课——也是彻底颠覆我最初认知框架的一点——就是:想要彻底攻克机器人问题,必须全方位引入极其广泛的先验知识(Prior Knowledge)。

许多从事机器人学习研究的人——包括早期的我自己——脑海中常年抱有一种执念:既然人类婴儿可以从一张白纸开始通过探索感知世界,那么机器人理所应当也该从零开始自主学习一切。

例如早年我们在 Google 开展大规模机器人学习研究时,曾做过一个著名的“机械臂农场”(ARM Farm)项目。当时因为没有专门的实验室,我们直接在一间空会议室里密密麻麻摆满了机械臂,让它们日以继夜地尝试抓取各种物体。

当时的想法极其纯粹:只要让机械臂盲抓数百万次,它一定能自主摸索出通用的抓取策略。

最终这套系统确实跑通了,机械臂确实学会了盲抓各种物体。但致命的问题在于:你很难在此基础上将技能进一步升级。学会抓取任何物体固然不错,但然后呢?这种白纸式的盲目探索,根本无法成为通向更高阶复杂技能的跳板。

其根源就在于我们当年采取了极端的白板假设(Blank Slate):试图在毫无先验认知的前提下从零起步,指望机器人自发涌现出高级智能。

但现在的我深信:若想让机器人真正走入现实,最务实的路径必然是将机器人的本体交互经验,与从外部世界海量数据中汲取的先验知识深度融合。

比如在早期,我曾对语言模型在机器人领域的实用价值极其怀疑。从纯生物学演化角度看,这种怀疑甚至是有据可循的:自然界中动物能做出极其惊艳的复杂动作,猴子能展现出难以置信的灵巧身手,但猴子显然不会说人类的语言。

我当时想:既然如此,我们的机器人只要能干活就行了,为什么非要让它理解语言呢?

但我后来意识到了其中的精妙本质:语言的真正价值不在于文字本身,而在于语言是承载庞大先验知识的最佳脚手架,能为学习过程提供无与伦比的先验认知引导。

你可以通过无数渠道向模型注入先验。人类和动物汲取先验并不完全依赖语言,更多是通过观察同类和外部环境。物理智能的先验来源多种多样,但核心在于:你必须先把这层先验知识垫在系统底层。

否则,你实际上是在逼迫机器人去解决一个比人类和动物演化史还要艰难得多的超难命题。如果让人类在有生以来从未见过任何家具的前提下去组装一件复杂的宜家家具,他同样会感到寸步难行——因为他甚至连这堆木板最终应该拼成什么样都一无所知。

先验知识至关重要。尽管我依然是“通过经验实践进行强化学习”的坚定拥趸,但如果能给当年的自己一句建议,我一定会说:

请给予先验知识更多重视。


一次编码,走向 AI 原生应用

8月26日 19:30-21:00

DCloud CEO 王安 × 银行资深架构师 陈政,聊聊跨端框架、端侧智能与 AI 原生应用的新变化。

直播可领 4 大技术资料包:

Łukasz Kaiser 演讲视频&PPT、C++之父精选合集、Agent 实战录播课、奇点智能大会嘉宾PPT。

扫码预约直播,明晚见!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
网传小米外包员工领中秋月饼遭拒:大厂外包,原来是最体面的职场二等公民

网传小米外包员工领中秋月饼遭拒:大厂外包,原来是最体面的职场二等公民

觉叔说
2026-09-22 12:58:32
炸锅!钟南山团队:71%肺结节患者从不抽烟,烟民可以更嘚瑟了…

炸锅!钟南山团队:71%肺结节患者从不抽烟,烟民可以更嘚瑟了…

慧翔百科
2026-09-24 08:35:18
中美两国元首夫妇移步白宫椭圆形办公室

中美两国元首夫妇移步白宫椭圆形办公室

澎湃新闻
2026-09-25 00:02:11
张本智和:日本队战胜了中国队,这一刻我已经等了10年以上

张本智和:日本队战胜了中国队,这一刻我已经等了10年以上

懂球帝
2026-09-24 19:50:06
张家齐演短剧一上午赚108元,被妈妈嫌弃,其实她图的从来不是钱

张家齐演短剧一上午赚108元,被妈妈嫌弃,其实她图的从来不是钱

陈意小可爱
2026-09-25 01:03:36
中东国家已然看清:采购再多的中国先进武器,也难以换来长久安全

中东国家已然看清:采购再多的中国先进武器,也难以换来长久安全

兵卒史
2026-09-24 20:27:00
中南大学一餐20元,新生心疼哭!打电话跟家长诉苦,说食堂饭菜太贵,引发热议

中南大学一餐20元,新生心疼哭!打电话跟家长诉苦,说食堂饭菜太贵,引发热议

火山詩话
2026-09-23 08:06:06
亚运乒乓-太危险了!3-2绝杀优势不大,王曼昱拿下张本美和拿第2分

亚运乒乓-太危险了!3-2绝杀优势不大,王曼昱拿下张本美和拿第2分

半壁胭脂色
2026-09-25 01:35:51
我和小饭馆老板娘搭伙三年,她男人突然回来我躲进了冰柜

我和小饭馆老板娘搭伙三年,她男人突然回来我躲进了冰柜

真实人物采访
2026-09-21 16:00:04
“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

世界圈
2026-09-22 15:46:08
中国女篮vs韩国时间敲定!CCTV5直播,扛住三重压力进决赛

中国女篮vs韩国时间敲定!CCTV5直播,扛住三重压力进决赛

破镜难圆
2026-09-24 17:46:30
美媒集体震惊:这次访华,才真正见识到中国温度!

美媒集体震惊:这次访华,才真正见识到中国温度!

福建睿平
2026-05-18 11:56:20
日本男乒已经“双核”了,国乒还在靠王楚钦抢2分,亚运丢冠并不冤

日本男乒已经“双核”了,国乒还在靠王楚钦抢2分,亚运丢冠并不冤

上观新闻
2026-09-24 22:09:29
孙女透露游本昌去世细节,晒全家福悲痛悼念,最后庆生照曝光

孙女透露游本昌去世细节,晒全家福悲痛悼念,最后庆生照曝光

180视角
2026-09-24 12:35:50
曾是歌坛一代天王,却沦为臭名昭著的台独分子,今家破人亡下场惨

曾是歌坛一代天王,却沦为臭名昭著的台独分子,今家破人亡下场惨

蜉蝣说
2026-09-22 11:49:00
国足尴尬半场!被马尔代夫零封,媒体人热议:愧对这身衣服

国足尴尬半场!被马尔代夫零封,媒体人热议:愧对这身衣服

奥拜尔
2026-09-24 20:31:44
国乒男团2-3输日本丢冠,邓亚萍点出排兵布阵硬伤,张本真涨球了

国乒男团2-3输日本丢冠,邓亚萍点出排兵布阵硬伤,张本真涨球了

罗纳尔说个球
2026-09-25 01:25:42
游本昌送别仪式月底在八宝山举行,好友称他去年年初生过一次病,之后挺过来了,最近几个月一直在住院

游本昌送别仪式月底在八宝山举行,好友称他去年年初生过一次病,之后挺过来了,最近几个月一直在住院

极目新闻
2026-09-24 13:59:38
心理学:敢于和亲人“不来往”的人,多半是这两种人,很准

心理学:敢于和亲人“不来往”的人,多半是这两种人,很准

心理观察局
2026-09-14 06:38:08
哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

户外阿毽
2026-09-23 15:23:41
2026-09-25 02:19:00
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2803文章数 7736关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

游戏
数码
家居
健康
时尚

《控制:共振》首个热更新上线 降低敌人血量

数码要闻

罗技G PRO X3 LIGHTSPEED头戴式游戏耳麦发售,到手价1699元

家居要闻

2026建博会(广州) 公装联探展交流活动

鼻子三角区的痘,千万别乱挤!

檀健次和孟子义,邀你一起来Fendi跳舞

无障碍浏览 进入关怀版