![]()
公司情报专家《财经涂鸦》获悉,7月19日,“高鹄资本·AI Frontier talks:引领智能新高度、创新智能新形态AI论坛”于2026WAIC期间举行。
现场,墨奇智能联合创始人兼CTO黄青虬就具身如何真正进入物理世界进行分享。
据天眼查APP,墨奇智能成立于2025年,由黄青虬与高文礼联合创立。CTO黄青虬生于1994年,是典型的“技术派”:清华自动化系本科、香港中文大学MMLab博士,师从林达华,长期研究机器人控制、计算机视觉与AI算法,发表数十篇顶会论文。
2020年他以“天才少年”身份加入华为智能汽车解决方案事业群,后任智驾AI部门负责人,主导华为智驾从ADS1.0到4.0的算法突破与量产,是业界第一个把一段式端到端(WEWA架构)做到百万规模量产的人。
墨奇智能诞生之际便不走单点Demo路线,而是锚定“软硬一体的系统工程能力”,以商用服务场景为技术训练场,瞄准通用家庭机器人的超级终端。
7月初,墨奇宣布已在六个月内完成超10亿元天使轮系列融资,投资方包括阿里巴巴、腾讯、蓝驰创投、君联资本、华业天成、高榕资本、中科创星、源码资本、光合创投、柏睿资本、58产业基金,高鹄资本担任独家财务顾问。
本轮融资完成后,公司估值超70亿元,成为目前国内具身智能赛道公开披露的首轮融资中规模较大的一笔。
以下为黄青虬演讲内容精编:
墨奇是一家以大脑为核心的具身公司,同时也涉及包括本体在内,例如小脑运控、底层软件、云端数据链路等在内的全栈技术。我们的使命是希望构建一个人、空间与自主的智能体共生的世界。
谈到具身走进真实场景,我觉得最重要的是三个能力。第一是效率,即机器人要干得足够快;第二个是准确率,即每个动作要做对;第三是泛化性,即机器人能处理各种异常情况。
但在不同场景对上述三个能力的要求维度不一样的。比如工业场景对准确率和效率有极致要求,但由于其完成的是单个原子动作,对泛化性的要求相对比较低;物流行业对准确率和效率相对工业低一点,但是因为要处理大小不一、有软有硬的包裹,对泛化性的要求相对高;服务业场景中,由于会遇到的物品SKU数量较多,因此也需要更强的泛化性。
在家庭场景中,泛化性的要求达到顶峰,因为每个家庭都不一样,每个人的物品数量成千上万。这也是我们要挑战的终极场景。
要推动具身逐步走这些场景,我们就要积累上述三个能力。首先是怎么让机器人动得更快。这次展会现场的机器动作还是比较慢,但真实的人干活其实是非常快的,两者效率差距至少有10倍。
解决效率问题有两个核心瓶颈。第一是更高效的模型架构。为什么具身的模型架构会比大语言模型更难,因为它必须跑在端侧,算力要更小。但具身模型要吸收的是现实物理世界中的高清视频流,相比于语言输入又更大,这就意味着我们要用更小的参数去吸收更大量的输入,所以模型架构设计其会更困难。
第二,具身是软硬一体的系统。如何构造这样一个高动态系统也是一个核心命题,我们认为有几个关键步骤。
一个是生成、理解、决策一体的原生模型。现实场景中,输入端可能是相机、触觉传感器加语言指令,但是我们最终要的输出只是一个动作,这时候你会发现输入的维度非常高,但是你的输出只是几个动作。而所谓动作只有十几维,当你输出特别稀疏时,就意味着你的模型在训练的过程中每次得到的反馈也会非常少,它模型的收敛就会特别慢。
怎么解决稀疏的问题?我们目前的模型架构里,会设计视频生成的信号,即像素上的稠密信号,还会设计一些语言的推理逻辑,不仅告诉机器人要干什么,还要告诉他怎么做。同时我们还会加各种感知的稠密信号,比如深度预测、语义分割,帮助模型更快地收敛,从而让模型用更小的参数量就能学会更大的动作空间。
另一个是移动操作一体。今天的很多机器人还是固定位置的,但人是一边走一边干活的。我们的机器已经能做到手臂操作和底盘运动能够一体化运动,只有能边走边干活,才能干得比较快。
模型之外,我们的整个系统也要做到软硬一体。机器人从看到一个图像到做出一个动作,首先要有模型的推理。怎么让推理更快,技术点有很多。我们在设计模型时,把训练和推理做了分离,能保证推理速度非常快;同时还有系统级的调度。这是我们独特的一个软件技术,可以让GPU和CPU这些不同的计算单元在不同模块上跑的时候不拥塞,并保证两个计算单元永远是跑满的,极致利用端侧算力。
另外,执行单元也很关键。我们在选执行单元的时候,不仅自研了关节,而且选型用的是行星关节,核心是看中其高动态,只有高动态的关节才能做出快速的动作。目前然我们的自研关节已经能够做到200赫兹的力矩响应,整个响应时延能做到200微秒以内。在我们的实验室,机器人的抓取速度人甚至还要更快一点。
准确率和泛化性方面,我觉得核心在于数据。
第一,只有准确的素材轨迹才能训练出准确的机器人运行轨迹。现在素材设备非常多,但真正用的时候它估的轨迹并不是很准。比如在白纸上写字,当相机面临到的是整个白色背景时,定位是非常困难的,但我们的设备即便在白色背景下,也能做到毫米级的定位精度,数采设备估出来的人的运动轨迹几乎一模一样。
第二,泛化性也来源于数据。我认为好的数据必须是真实的场景,真实的人,在里面干真实的活。为了解决这个问题,我们在素材的整套系统链路上做了很多努力。目前,我们已经有几十套、上百套的足够轻便设备进入到真实场景,让清洁或者各种服务人员应用。
最后,对数据而言,除了估计和采集,更重要的是要有一套飞轮系统。在云端,我们有一套云端链路系统,包括从采集、质检、挖掘、标注,到大规模的训练、评测,到评测之后遇到的一些column case,再到重新回端侧做采集。墨奇用了半年的时间,几乎50%的精力都花在建这套系统上。
我觉得这是未来整个具身竞争壁垒的关键,因为只有快速高效的数据运转,才能驱动我们的模型一步一步的往前迭代。
以下为高鹄资本管理合伙人金明与黄青虬的现场对话:
Q:你认为自动驾驶和机器人有何异同?
黄青虬:两者的共同点是,他们属于物理AI范畴。物理AI有两个关键词,实时和闭环。所有物理AI都是一个实时闭环系统,这是它区别于虚拟世界的AI最大的一个特点。
所谓实时,就是你在做一件事情时候,其实每分每时每刻每秒都在做决策。哪怕只是拿起一瓶水,你要观察水瓶给你的力度反馈,不断调整压力,既不把瓶子捏扁同时又有足够的摩擦力把它拿起来。这需要一个连续性的决策。
大语言模型不是这样。它是一个轮次式的回答,你问一个他答一个,慢几秒没有问题。但具身和智驾是必须要进行实时回答、实时决策。
所谓闭环是指具侧会影响物理环境。比如拿起一瓶水时,压力会发生变化的,大语言模型在回答问题过程中,至少在单轮的回答中,你周围的环境是不会变化的。
因此,实时的闭环系统会带来很多物理世界的挑战,这是智能驾驶和具身智能的共同点。
不同之处在于,具身比自驾要更难一点,体现在两方面。一方面,智驾是在一个平面移动,而具身要升级到三维世界。每升级一个维度就意味着你的求解空间会有一个爆炸性的增长。
另一方面是接触。智能驾驶只要避开障碍物,不需要摩擦力、压力;但具去接触物体,因此需要对物理属性有更深层次的理解。这两点也是具身面料的最大挑战。
Q:在你看来,未来12个月在模型、数据、硬件领域最有可能实现突破的是哪些地方?
黄青虬:我认为不同的模型路径之间并不是严格对立。模型的本质就是一个输入到输出的压缩以及模态转化的系统,具体用世界模型还是VLA进行训练,在我看来只是模型之上工具。是工具就可以随意调用和转换。
大语言模型也经历了很多轮训练式和模型架构的转变,但只要我们抓住模型的本质,可以灵活应用这些工具去产生一个最高智能的模型就可以了。
Q:你怎么看待中国的具身在全球的地位和竞争?
黄青虬:对中国科研工作者来说,具身是一个非常好的机会。首先它有一定的硬件属性,中国的供应链和生产制造能力在这方面有一定的优势。而硬件的优势决定了迭代速度。在中国,硬件的迭代速度可能是以周为单位周期,但美国可能以月为单位周期。
其次是场景。相较于大语言模型,具身需要进到真实场景做采集,那么场景更丰富的地方在数据上就有一定优势。
第三是模型。在算法上,目前中国和美国在大语言模型上仍有一定差距,但具身我们处于同一个起点,这是很难得的机会。我希望我们能借助前两个优势弥补最后一个可能处于劣势的地方,跟美国的科研工作者并驾齐驱,一起去探索机器人的未来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.