网易首页 > 网易号 > 正文 申请入驻

7 篇 ECCV 论文!极佳视界联合顶尖高校,打通空间智能从「看得稳」到「摸得准」再到「决策灵」的落地瓶颈

0
分享至


以推理决策与物理重建,让空间智能从生成走向因果交互。

作者丨张 璐

编辑丨幸丽娟

在生成式 AI 的演进历程中,从二维像素走向三维物理世界,是人工智能迈向现实落地的必经之路。

以 3D Gaussian Splatting、Sora 级视频生成以及多模态大模型为代表的技术,曾让行业看到了空间智能的巨大潜力。然而,当这些原本运行在数字世界中的算法尝试走向真实硬件与物理场景时,整个行业正在遭遇一场前所未有的“落地阵痛”。

当前的视觉与空间模型看似绚丽,却普遍陷入了三重难以逾越的瓶颈:决策依赖暗盒式的直接预测,缺乏对物理因果的常识推理;三维资产仅停留于视觉逼真,剥离了质量与形变等物理属性;世界模型缺乏对动作控制的精确响应,沦为无法评估安全的离线画面。

缺乏逻辑推理、缺乏真实物理属性、缺乏控制闭环,这三大软肋直接阻断了物理 AI从实验室 Demo 迈向工业落地的可能。突破这些瓶颈的关键,不再是单一模型参数的堆叠,而是要建立一套贯穿“空间感知、物理推演到具身决策”的技术演进图谱。

在本届计算机视觉顶级学术会议 ECCV 上,极佳视界(GigaAI)展现出了极其瞩目的学术爆发力,共有 13 篇论文成功入选。其中,有 7篇落在了空间智能这个研究方向。

极佳视界联合清华大学、中国科学院自动化研究所、浙江大学、上海交通大学等顶尖学术机构,将这 7 项重磅研究汇聚成了一套完整的技术破局方案。不同于零散的学术试验,这一系列成果展示出了一条极其清晰的技术演进路径:物理 AI 的终局,不仅是生成逼真的画面,而是打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的具身大脑。


01


打破暗盒与离线,

重构具身大脑与试车场

在传统的具身智能与自动驾驶开发中,模型大多扮演着一个“暗盒”角色:输入传感器图像与自然语言指令,通过端到端神经网络直接预测并输出末端执行器的动作坐标或车辆轨迹。

这种“图像进,动作出”的暗盒模仿范式,在环境简单、分布内的数据集上或许能跑出不错的成功率。然而,一旦面对真实世界中复杂的物体遮挡、未见过的物品样式、随机的动态扰动以及长程多步骤任务时,暗盒模型就会暴露出致命的缺陷:它无法解释自己“为什么这么做”,也无法在遇到偏差时进行自我修正。

极佳视界的破局思路很明确:把“思维链推理”与“强化学习”深度融入决策闭环。无论是微观的桌面操控,还是宏观的道路驾驶,都打造出了可落地的技术标杆。

从暗盒操控到显式推理:VLA-R1 将 R1 强化学习引入具身决策


论文:VLA-R1:Enhancing Reasoning in Vision-Language-Action Models 合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学 论文链接:https://arxiv.org/abs/2510.01623

传统的具身操控大多依赖暗盒式的模仿学习,试图直接从像素跳跃到末端执行器的控制坐标。这种跳过逻辑推导的直觉反应,在面对遮挡、复杂常识与多目标干扰时极易失效。

要打破这种局限,关键在于赋予模型像人类一样“先推理、后动手”的能力。

极佳视界联合中科院自动化所、清华大学打造的VLA-R1框架,首次将类似 DeepSeek-R1 的强化学习(RL)与显式思维链(CoT)深度融入具身操控中。


VLA-R1 整体训练框架:结合 SFT 显式思维链推理与 GRPO 强化学习的多维可验证奖励对齐

VLA-R1 改变了传统模型直接输出动作坐标的做法,强制要求模型在输出控制指令前,先生成一段可解释的文本思维链。机械臂必须像人类一样,显式推导并回答“当前物体的空间遮挡关系如何”、“哪一个是目标容器”、“如何规划无碰撞路径”等物理常识问题,并同步预测出物理可供性区域与 3D 运动轨迹。

为了支撑这一高质量的逻辑推导,团队专门构建了包含 1.3 万条精细化标注的 VLA-CoT 数据引擎,为模型注入丰富的物理常识与空间因果关系。同时,在强化学习训练阶段,VLA-R1 摒弃了传统人工打分或模糊的倾向性奖励,而是从空间对齐、轨迹一致性与输出格式规整度三个维度设计了可精确计算的硬约束奖励机制(GRPO),大幅提升了模型在复杂场景下的决策稳健度。

在实验评估中,引入 GRPO 强化学习后,VLA-R1 的可供性区域 IoU 指标飙升至36.51,轨迹平均误差大幅降至91.74

复杂任务实例:把面包放进微波炉

在真实餐桌场景的复杂真机测试中,面对物体的临时移动与随机遮挡,配备 VLA-R1 的机械臂表现出了极强的鲁棒性与确定性,将具身操控从“碰运气式模仿”带入了“可解释、可验证决策”的新阶段。

从视频播放到闭环评估:OmniNWM 打造可响应、能打分的驾驶世界模型


论文:OmniNWM: Omniscient Driving Navigation World Models 合作机构:上海交通大学 × 清华大学 × 鉴智机器人 × 东方理工大学(联合新加坡国立大学、武汉大学等) 论文链接:https://arxiv.org/pdf/2510.18313

如果说 VLA-R1 攻克的是微观物理空间下的具身决策,那么在宏观自动驾驶领域,物理 AI 则需要一个具备全局视角与动作响应能力的世界模型作为“数字试车场”。

在自动驾驶与宏观导航场景中,过去的世界模型大多停留在“生成逼真视频”的离线展示阶段,既无法响应连续的动作控制,也缺乏安全评估机制。极佳视界联合上海交大、清华等机构推出的OmniNWM,则在单一生成框架下实现了状态、动作与奖励打分的三者统一。


OmniNWM 核心架构图

在状态表征上,OmniNWM 打破了单一 RGB 摄像头的视觉局限,能同步生成全景 RGB 视频、语义分割图、度量深度图以及 3D Occupancy(占据网格),确保生成的虚拟环境具备高度一致的空间物理表征。

在动作控制层,它利用归一化的全景 Plücker 射线图将车辆轨迹编码为像素级控制信号,彻底解耦了对特定相机外参的依赖,使得生成的视频与 3D 空间能够极其精准地响应任意车辆规划的转向、加速与换道轨迹。

更具颠覆性的是其评估机制,OmniNWM 抛弃了外接评估模型的传统做法,直接利用内生生成的 3D Occupancy 占据网格,构建了一套面向碰撞安全与交通规则遵循的稠密奖励函数。这使得模型在合成未来预测场景的同时,就能自动为当前车辆的驾驶策略进行精准打分。

3D 语义占用场景演示

实验表明,OmniNWM 在视频生成质量、长时距生成稳定性以及控制响应精度上均达到了行业领先水平。它将驾驶世界模型从单纯的“画图工具”,正式推进至能够直接服务于自动驾驶端到端策略训练与安全测试的数字试车场基础设施。

02


告别“纸片模型”,赋予 3D 资产

真实物理触感与 4D 动态推演

解决了大脑的逻辑推理与闭环评估后,物理 AI 面对的下一个核心考题,是“环境与资产”的真实性。如果仿真世界里的物体只是视觉逼真,机器人一旦与之发生力学交互或跨时空演进,系统就会因为缺乏真实物理响应而失去意义。

极佳视界的破局点,在于将“视觉表征”与“物理系统”深度结合,并打通了从静态 3D 到动态 4D 的连续推演通道。

从离线优化到秒级重构:ReconPhys 赋能 3D 资产真实物理属性


论文:ReconPhys:Reconstruct Appearance and Physical Attributes from Single Video 合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学 论文链接: https://arxiv.org/abs/2604.07882

传统方法在赋予 3D 资产形变与力学参数时,通常依赖极其昂贵的人工标注与离线计算,需要针对具体场景优化数小时,极难规模化应用。

极佳视界联合中科院自动化所、清华大学发起的ReconPhys研究,打破了外观重建与物理估计割裂的范式。它创新性地将 3DGS的视觉表示与可微弹簧-质点物理系统深度绑定,让高斯粒子在具备几何外观的同时,天然绑定了刚度、质量与阻尼等物理属性。


为了摆脱对人工物理标注的依赖,团队利用可微渲染与可微物理系统的协同,构建了纯视觉引导下的自监督优化链路,仅凭渲染像素级的监督即可反向推导出物体的真实物理特性。

更具实用价值的是,ReconPhys 将繁重的物理反算过程消化在训练阶段。在实际推理时,模型无需再进行离线迭代,仅需输入一段普通的单目视频,不到 1 秒即可直接前馈式输出一套绑定了完整物理属性的 3DGS 资产。


这种秒级物理重构的能力,为机器人柔性操控、物理图形仿真以及大规模 Real-to-Sim 数据生成提供了低门槛的高效入口。

从静态定格到几何感知:MoGe4D 驱动单图推演 4D 动态世界


论文:Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation 合作机构:极佳视界× 清华大学 论文链接: https://arxiv.org/abs/2512.05044

静态空间的表达已被逐渐攻克,但真实世界本质上是随时间连续演进的。以往的方法常常将 3D 重建与动态运动生成剥离,导致 4D 画面在视角变动或动态生成时频频出现结构崩塌。

极佳视界与清华大学提出的MoGe4D,尝试将两者在统一框架下深度打通。它先从单张图片估计出初始的三维几何结构,再以此几何为强约束条件,利用专门的 4D-STraG 模块预测空间各点相对于首帧的动态轨迹,最后由 4D-ViSM 模块完成任意视角下的动态渲染。

此外,团队还专门构建了包含 6 万组带稠密 4D 点轨迹的真实视频数据集 TrajScene-60K,为运动生成提供了坚实的数据支撑。在渲染质量、视角一致性与时空稳定性上,MoGe4D 大幅超越了现有的主流生成范式,单张显卡约 6 分钟即可稳定推演出高质量的 4D 视频,为沉浸式影视、空间内容生产与数字孪生提供了更统一的技术工具。


传统 4D 生成范式(a、b)与 MoGe4D 几何感知生成范式(c)的技术路线对比

03


筑牢工业级 3D 高精几何底座

与工程落地管线

具身大脑决定了如何决策,真实物理赋予了触感与环境响应,而最底层的三维几何重建,则是支撑起整个物理 AI 世界的技术地基。

在过去的 3D 感知与重建管线中,行业普遍面临着两难境地:要么为了追求几何一致性而陷入极其昂贵的算力开销;要么为了追求生成速度,导致重建出的 3D 资产充斥着杂点、重影与边缘模糊。

极佳视界通过一系列从算法范式到工程架构的创新,把 3D 感知与重建推向了“工业级可用”的高标准。

从 2D 匹配到 3D 对齐:VolSplat 构建稳定可信的三维体素几何


论文:VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction 合作机构:极佳视界 × 浙江大学× 香港中文大学 × 清华大学×南洋理工大学 × 阿德莱德大学 × 莫纳什大学 论文链接: https://arxiv.org/abs/2509.19297

现有的前馈式 3DGS 重建方法,大多依赖 2D 像素特征强行推算 3D 结构,在面对多视角或弱纹理场景时极易产生杂点与几何扭曲。

极佳视界联合浙大、清华等多所全球顶尖高校推出的VolSplat,直接抛弃了传统的 2D 盲目匹配范式。它将多视角图像特征反投影到统一的 3D 体素网格中进行空间融合,再由 3D 解码器在体素空间直接预测高斯参数。


传统像素对齐范式(左)与 VolSplat 体素对齐范式(右)的前馈 3DGS 重建流程对比

这种从2D 匹配转向3D 对齐的建模方式,不仅让多视角对齐自然地发生在三维空间中,还能根据场景复杂度按需调整高斯密度,显著提升了几何一致性与可信度。这为前馈式 3DGS 提供了一条更符合空间结构本质的技术路线,也推动了 3D 内容生产从快速生成迈向稳定生成、可信生成。

工业级工程优化:AnchorSplat 与 2K Retrofit 解锁高清与低功耗

在建立了稳定的体素几何框架之后,极佳视界还针对工业生产管线中的“渲染细节”与“算力吞吐”两大落地瓶颈,给出了极具实用价值的工程解决方案:

从反向优化到点锚机制:AnchorSplat 0.01 秒重塑高频细节

论文:AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting 合作机构:极佳视界 × 中国科学院自动化研究所 × 上海科技大学 × 清华大学 论文链接:https://arxiv.org/pdf/2607.01290

现实中许多通过 AI 生成或扫描的粗糙 3D 资产普遍存在偏糊、偏稀的问题,而传统耗时数分钟的反向优化极难适应工业流水线。

极佳视界与中科院自动化所、上科大推出的AnchorSplat,打造了一个完全运行在 3D 空间内的即时资产增强网络。

它通过“点锚机制”约束新高斯粒子的局部生长,以单次倍增替代传统的迭代密化,在0.01 秒内即可重塑高频细节,为大规模 3D 内容生产与资产修复补齐了关键一环。

从全图计算到稀疏精修:2K Retrofit 低功耗解锁生产级高清


论文:2K Retrofit:Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction 合作机构:极佳视界 × 北京航空航天大学 × 国防科技大学(联合 OpenHelix Robotics 等) 论文链接:https://arxiv.org/pdf/2603.19964

针对自动驾驶全景感知等大场景高清预测中的算力爆炸难题,极佳视界联合北航、国防科技大学等机构发起的2K Retrofit,洞察到几何预测残差 90% 以上都集中在边缘与遮挡交界处。

模型无需修改或重训原始 Backbone,而是利用冻结的基础模型生成稳定的全局粗几何,再利用熵信息精准定位少量关键区域进行稀疏精修。

这种“全局稳态 + 稀疏精修”的思路,以极低的算力开销将现有的几何基础模型直接推进至 2K 分辨率的生产级应用场景。

04


结语:从视觉生成

迈向物理世界的闭环演进

纵观极佳视界在 ECCV 上展现的学术成果,13 篇入选论文展现了其深厚的学术积淀,而其中直指“空间智能与物理 AI”的 7 项重磅成果,则勾勒出了一条极其严密的技术演进主线:

VolSplat、AnchorSplat 与 2K Retrofit打牢工业级 3D 几何底座;以ReconPhys 与 MoGe4D赋予空间 4D 动态推演与真实物理触感;最终通过VLA-R1 与 OmniNWM在具身操控与驾驶场景中打通“逻辑思考、动作执行与闭环评估”的完整决策链路。

空间智能与 Physical AI 的终局,绝不仅仅是生成一段漂亮的视觉 Demo 或重建一个精致的静态模型,而是要打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的数字与物理实体。

物理 AI 的竞争,正在从单纯的“画质比拼”与“离线生成”,全面转向“物理可信、逻辑可推理、控制可闭环”的深水区。极佳视界通过这一系列全栈技术的集中布局,不仅攻克了具身智能落地的关键瓶颈,更在通往下一代通用物理世界 AI 的征程上,铺设了切实可行且具备示范效应的技术基石。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
克洛普:我愿为球员赴汤蹈火;两年多没带队训练,还好没生疏

克洛普:我愿为球员赴汤蹈火;两年多没带队训练,还好没生疏

懂球帝
2026-09-23 20:20:13
美国中将公开承认:打完伊朗,我才看清中国到底有多强大!

美国中将公开承认:打完伊朗,我才看清中国到底有多强大!

果妈聊娱乐
2026-09-17 08:20:56
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
斯诺克官宣!丁俊晖领衔,3大TOP16缺席,中国军团10人直通正赛!

斯诺克官宣!丁俊晖领衔,3大TOP16缺席,中国军团10人直通正赛!

刘姚尧的文字城堡
2026-09-23 08:36:19
2-0! 王欣瑜强势晋级16强, 中国网球1日2大喜讯! 郑钦文最新动态更新

2-0! 王欣瑜强势晋级16强, 中国网球1日2大喜讯! 郑钦文最新动态更新

云隐南山
2026-09-23 02:19:02
突发!陈冠希的新瓜,有点料!

突发!陈冠希的新瓜,有点料!

财经要参
2026-09-23 07:56:49
泽连斯基被曝与美国中央情报局局长在机场会面,知情人:两人在飞机加油期间进行了非正式交谈

泽连斯基被曝与美国中央情报局局长在机场会面,知情人:两人在飞机加油期间进行了非正式交谈

极目新闻
2026-09-22 10:22:09
不许降落加油!美国“掐断”伊朗全球航线

不许降落加油!美国“掐断”伊朗全球航线

凤眼论
2026-09-22 19:34:42
战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

体娱一家亲
2026-09-23 17:08:01
高圆圆在播客中首谈死亡:已和赵又廷商量好谁先走,理想告别是提前整理好东西不给孩子留麻烦

高圆圆在播客中首谈死亡:已和赵又廷商量好谁先走,理想告别是提前整理好东西不给孩子留麻烦

一盅情怀
2026-09-03 11:23:06
绝绝紫!凯特王妃出席首映礼,解锁了一条压箱底近百年的项链

绝绝紫!凯特王妃出席首映礼,解锁了一条压箱底近百年的项链

不太爱笑的小羊
2026-09-23 13:11:15
女儿为给发热父亲降温,用干冰直接敷在其身上,导致全身多处“冷烧伤”,医生:如同拿烧红的烙铁往皮肤上贴

女儿为给发热父亲降温,用干冰直接敷在其身上,导致全身多处“冷烧伤”,医生:如同拿烧红的烙铁往皮肤上贴

扬子晚报
2026-09-23 07:31:22
刘强东拿下张雪机车,震动行业!

刘强东拿下张雪机车,震动行业!

互联网品牌官
2026-09-23 11:50:56
财政部为什么是党组、公安部为什么是党委?

财政部为什么是党组、公安部为什么是党委?

画生笔记
2026-09-20 09:10:50
公务员严查再升级!这5类行为,纪委查到一起处理一起!

公务员严查再升级!这5类行为,纪委查到一起处理一起!

职场资深秘书
2026-09-23 12:28:40
苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

小柱解说游戏
2026-09-23 00:30:51
陈妍希回应一天只吃一顿:白天喝咖啡能维持比较清醒的状态,晚上跟朋友约饭,是比较适合自己的方式;医生提醒:减肥不能以牺牲健康为代价

陈妍希回应一天只吃一顿:白天喝咖啡能维持比较清醒的状态,晚上跟朋友约饭,是比较适合自己的方式;医生提醒:减肥不能以牺牲健康为代价

台州交通广播
2026-09-22 12:00:00
随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

大秦壁虎白话体育
2026-09-23 15:25:22
热议亚运男足小组第一出线:安东尼奥就是可以拿到想要的结果

热议亚运男足小组第一出线:安东尼奥就是可以拿到想要的结果

懂球帝
2026-09-23 16:49:54
“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

世界圈
2026-09-14 15:05:05
2026-09-23 20:35:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

亲子
游戏
旅游
家居
公开课

亲子要闻

用幼儿园洗菜池洗鞋的食堂员工,就是奴才

长的丑就要被鬼追着杀!恐怖猎奇新游设定巨诡异

旅游要闻

赶紧收藏!中秋、国庆惠阳上新40项文旅活动

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版