网易首页 > 网易号 > 正文 申请入驻

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

0
分享至


学习模型已经具备很强的局部视觉先验,而 3D 几何可以帮助建立跨视角、长距离的全局一致性。二者如何结合,是 3D 视觉与空间智能中的重要问题。

编辑丨岑峰

在生成式 AI 的快速发展中,Sora 等视频和图像扩散模型(Diffusion Models)展示了很强的视觉生成能力。大规模 2D 数据让模型学到了丰富的视觉与语义先验,在单帧和局部视频生成上取得了显著进展。但当任务进一步要求多视角、长距离的 3D 一致性时,仅依赖数据驱动的局部先验仍会遇到挑战。

与此同时,在 3D 视觉和场景生成中,一个长期问题是如何把局部生成结果组织成全局一致的 3D 世界。现有视觉大模型在某些场景中仍可能出现跨视角结构不一致、物体数量或布局不合理等现象。

例如,当提示词中出现“卧室”时,模型有时会生成多张床;当虚拟相机在生成场景中进行较长距离漫游时,也可能出现建筑结构逐渐扭曲等问题。这些现象说明,模型从数据中学到的局部先验非常强,但对全局 3D 结构的约束仍然不足。引入显式的 3D 几何,可以为这些局部预测提供跨视角的结构约束,帮助构建更一致的全局结果。

在今年的欧洲计算机视觉国际会议(ECCV)上,香港科技大学教授谭平围绕这一问题介绍了团队近期在 3D 重建与 3D 场景生成方面的工作:学习方法提供强大的局部先验,3D 几何则用于组织和约束这些预测,从而提升大规模场景中的全局一致性与可扩展性。

谭平师从国际 3D 视觉泰斗权龙教授,长期从事 3D 视觉研究。本次演讲延续了这一方向,重点讨论如何把学习方法的表达能力与多视图几何、全局优化等经典 3D 方法结合起来。

在演讲中,谭平教授将 3D 重建与 3D 场景生成放在同一框架下讨论:无论是从图像重建 3D 世界,还是生成可漫游的 3D 场景,学习模型已经能够提供非常强的局部先验;而要把这些局部结果组织成全局一致的 3D 表示,几何结构与全局优化仍然具有重要作用。

在重建任务中,前馈网络高效且鲁棒,但在大规模输入和高精度位姿估计上仍有计算与一致性问题;团队借鉴视觉 SLAM/SfM 的关键帧思想,并结合集束调整(Bundle Adjustment)进行全局优化。在生成任务中,则通过显式 3D 布局或 3D 代理(Proxy)提供结构约束,再利用生成模型补充外观与细节,从而改善大场景漫游时的空间一致性。

这场演讲想强调的并不是学习方法与几何方法的二选一,而是二者的互补性:学习模型擅长从大规模数据中获得强大的局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。对于空间计算、世界模型和具身智能,这种“学习先验 + 几何约束”的结合值得进一步探索。

以下是谭平教授的演讲分享,AI科技评论根据其英文演讲内容进行了不改原意的编辑:


演讲标题:《几何的反攻:规模化 3D 重建与结构化 3D 场景生成》

(Geometry Strikes Back: Scaling3DReconstruction and Structuring 3D Scene Generation)

演讲者: 香港科技大学 谭平

今天我将分享我们近期在 3D 视觉和 3D 场景生成方面的工作。近年来,以 VGGSfM(或 DUSt3R 类前馈网络)为代表的基于大型 Transformer 的方法取得了很大进展。这类方法的基本思路非常直观:接收一组输入图像,提取特征,然后通过大型 Transformer 直接估计相机位姿、深度图和点云,并获得很强的局部 3D 重建效果。


然而,我们注意到这类方法存在一个明显的计算瓶颈。我们统计了网络在处理不同数量图像时的 GPU 内存使用情况,通常情况下,在消费级 GPU 上很难一次处理超过 100 张图像。

01


大规模 SfM 方法:用“神经场景表示”

缓解 Transformer 的显存瓶颈

因此,我们希望从借鉴传统的SfM(运动恢复结构)与视觉SLAM的理念,在SLAM中我们会刻意将建图和追踪线程分开。建图是一个计算成本极其高昂的过程,因此通常只在少数的关键帧上执行;而对于海量的非关键帧,系统只执行计算负担极小的定位操作。


我们的大规模 SfM 方法正是脱胎于这一核心思想:我们是否可以利用前馈网络,先构建出某种高效的“神经场景表示(Neural Scene Representation)”作为3D地图,然后以此来大幅简化其余帧的计算?

以下是我们的系统流程图。首先从从海量输入图像中均匀采样出一部分关键帧,我们称之为锚点帧,将其送入前馈网络获取初始的 3D 结构。最核心的一步在于“Token 采样”:在完成帧间注意力计算后,我们打破了每帧保留固定 Token 的常规做法,引入了随机性策略,为每张图像随机保留 20% 到 50% 的 Token,并将所有关键帧的这些 Token 聚合成一个单一的、全局的“场景表示”。


这一轻量化设计显著降低了全局建模时的显存开销,使方法能够扩展到更大规模的输入图像。

有了这个轻量级的高维“3D 地图”,对于所有庞大的非关键帧,我们只需通过帧间注意力机制与该场景表示进行交互,执行全局注意力计算,就能直接得出其相机位姿、深度图和点云。这里是一些结果的可视化。

我们的方法能够处理更大规模的图像,并生成稠密、合理的 3D 点云与相机轨迹;与基线相比,因位姿不准导致的“重影”等伪影明显减少。在 Tanks and Temples 等复杂数据集的测试中,大约 70% 的情况下,相对旋转和相对平移误差都能控制在 5 度以内。

这是视觉渲染结果。我们可以看到点云非常合理,而且相机轨迹与真实值高度吻合。

我还想分享一个关于“评估标准”的发现。过去,很多工作会把传统标杆算法 COLMAP 算出的相机位姿作为参考真值。但我们的研究也发现,COLMAP 本身存在估计误差,因此将其直接视为绝对真值也有一定局限。

为此,我们提取 90% 的输入图像,用我们的方法估计位姿并训练一个 NeRF 模型;最后在预留的 10% 未见视角上计算渲染图像的 PSNR(峰值信噪比)。结果显示,我们的方法在渲染质量和 PSNR 指标上优于以 COLMAP 位姿训练得到的结果。

02

Global 3R:

前馈网络与全局 SfM 的融合

至此,我们实现了前馈 3D 重建的规模化扩展。但在更大场景中,单纯依靠前馈预测仍可能出现误差累积和尺度不一致的问题。

于是我们提出第二个问题:能否将神经网络前馈方法的鲁棒性和效率,与传统全局 SfM 优化的几何精度结合起来,使系统同时兼顾可扩展性与全局一致性?

这就引出了我们近期的另一项工作Global 3R


其基本流程是:

  • 给定输入图像,首先提取滑动窗口。在每个滑动窗口内,应用前馈神经网络(例如类似CroCo/RoMa匹配网络)计算图像对之间的相对运动和点云等信息;

  • 接着,采用新方法在窗口内选择关键帧,并计算该关键帧与窗口内所有其他帧的匹配与对齐,从而获取一致的特征轨迹(feature track);

  • 构建位姿图,依次进行旋转平均和平移平均,最后执行集束调整,生成最终的3D结果。


当前方案的优势在于无需指定固定的参考帧,能够灵活选择任意局部窗口作为参考。

求解相对运动并选定关键帧后,我们通过形变操作将其余帧特征对齐至关键帧,并计算对齐置信度。可视化结果表明,对应帧向关键帧形变的效果在多数情况下非常合理,结合形变置信度,该方法能够有效筛选出最终的高质量匹配结果。

优化过程表明,集束调整(BA)对3D点云质量的提升十分显著。在仅进行运动平均时,重建画面会出现重影(如同一物体被重复重建);而在BA优化过程中,特征逐渐对齐融合,最终生成结构一致的3D点云模型,并能清晰呈现相机的位姿轨迹。

当前,学界也有许多研究者在探索相似的融合思路,例如苏黎世联邦理工学院(ETH)将深度学习与全局SfM结合的相关工作。

在位姿精度评估方面,我们通过新视角合成,在Tanks and Temples数据集预留的10%图像上计算PSNR。结果显示,该方法在预留图像上取得了最高的PSNR,超越了包括COLMAP及其他先进前馈网络在内的所有基线方法。从NeRF新视角合成的结果来看,本方法生成的渲染图在细节上更接近真实图像。

在相机位姿精度方面,ETH3D 数据集上 1 度阈值下的结果表明,本方法取得了很高的旋转精度,在多个场景测试中该指标可达到 100%。

进一步的误差分析揭示了本方法精度更高的原因。以1度以内的相对旋转误差图表为例:初始网络预测仅有约70%的图像对达标,后续运动平均的改善有限;而严谨的几何优化即集束调整(BA),将精度从70%显著跃升至90%以上。这种几何约束在相对平移误差上的提升更为显著:运动平均后精度仅约35%,经集束调整后直接翻倍,提升至70%以上。

03

3D 场景生成:用“显式布局”

增强全局空间一致性

接下来是3D场景生成。当前图像和视频扩散模型已擅长生成高质量单帧和局部一致的片段。我们将介绍如何利用3D几何作为约束,将这些局部画面拼接成完整的3D世界,主要涉及三项工作。

首先是受 Text2Room 启发的两项研究。Text2Room 能根据文本生成 3D 房间,其思路是利用图像扩散模型逐步生成不同视角,最终拼接成全景图。不过,由于生成过程主要在局部视角上调用扩散模型,缺少显式的全局 3D 场景布局(scene layouts)约束,因此有时会出现家具数量或空间布局不合理的问题。


为此,我们在近期发表的ControlRoom工作中引入了显式布局生成,将生成过程解耦为“布局生成”和“外观生成”两阶段。第一阶段,训练扩散模型根据文本生成由边界框(bounding boxes)和语义组成的3D房间布局,并渲染出语义全景图。第二阶段,将该语义布局作为控制信号(ControlNet),指导高保真全景图的生成,以用于后续的3D可视化。

在布局生成环节,模型使用向量编码物体的坐标、尺寸和方向,并拼接为统一代码序列。基于该代码空间和真实结构化数据训练扩散模型,同时引入视觉先验以学习房间陈设的常见规律(如卧室通常包含床等家具)。此外,为改善外观渲染时全景图左右边界的衔接,我们在扩散过程中引入随机循环平移(random circular shift),显式增强循环一致性。对比测试表明,没有显式布局约束时可能出现一间卧室生成多张床等不合理结果,而布局引导有助于生成更合理的家具配置。

尽管ControlRoom效果显著,但仍存在局限:一是仅生成固定全景图,存在视角盲区,无法实现真正的自由3D漫游;二是受制于现有3D数据集规模(如Structured3D仅含两万个房间),场景与物体丰富度不足。这促使了我们的第二项工作SpatialGen。


为突破数据瓶颈,我们发布了规模提升一个数量级的SpatialGen数据集。它涵盖1.2万个场景、5.7万个房间,包含62个物体类别的约100万个边界框。此外,数据集提供了约500万张包含RGB、语义/实例分割、反照率图、深度图和法线图等6种模态的渲染图像,可广泛应用于场景生成与理解。

基于该数据集,SpatialGen提出了一种“布局引导(layout-guided)”的多视角多模态扩散模型。模型输入3D布局与参考图像(或文本),联合训练生成RGB图像、语义图像,以及由“场景坐标图(scene coordinate maps)”编码的3D绝对几何信息。这种空间信息对维持多视角和模态一致性至关重要。随后,不同视角的图像被迭代融合至3D高斯(3D Gaussian)模型中。推理新局部视角时,通过投影3D高斯模型进行反向引导生成。该方法不仅能构建高质量3D场景,还支持强大的风格迁移,可在相同3D布局下生成欧式、中式或赛博朋克等截然不同风格的房间。

在此基础上我们发现,SpatialGen强制要求输入显式3D布局的设定在实际应用中缺乏灵活性(用户通常只提供单张图片),且局限于结构性较强的室内场景。这一痛点为我们指明了下一步的技术进化方向。

04

SpatialCraft:单图推断 3D 代理,

解锁大场景的自由漫游

我们的第三项工作 SpatialCraft 进一步面向上述局限,采用两阶段策略。


第一阶段从单图生成 3D 代理(3D proxy)。通过在大量 3D 场景上训练的扩散模型,从单图推断出粗略的 3D 空间基底;在此基础上设置相机轨迹并渲染基础的 3D 漫游视频。第二阶段再引入视频扩散模型(video diffusion model),对基础视频进行 refinement,进一步提升纹理细节和视觉质量。

在第一阶段的技术细节中,核心是保持“像素对齐(pixel alignment)”以保留原始输入图像的特征。具体做法是将输入图像提升为深度图并转换为 3D 体素(voxels),利用网络补全场景中的不可见区域。这样可以让生成过程在可见区域与输入图像保持对齐,并为后续视角生成提供较稳定的 3D 结构;随后这些体素会被进一步处理为场景的 3D 高斯表示。

第二阶段则更侧重于“视频优化(video refinement)”。3D 代理已经提供了基础场景结构,可以对跨视角的空间关系形成约束;在此基础上,视频扩散模型重点优化画面的纹理细节和视觉质量。

实验结果表明,该方法不仅适用于室内场景,也能扩展到室外自然场景。即使相机进行较大范围移动,生成的漫游视频仍能较好保持空间一致性;在长视频生成测试中,相比现有基线,远离初始视角后仍能保持更稳定的场景结构。


总结而言,本次分享聚焦 3D 重建与 3D 场景生成两大方向。在 3D 重建中,深度学习前馈方法提供了强大的运动和结构先验,而多视图几何优化(如集束调整 BA)可以进一步提升全局精度与一致性。在 3D 场景生成中,现有大模型具备很强的局部生成能力,显式 3D 几何约束则有助于减少不合理结果,并支持更稳定的多视角与长距离生成。

因此,我更愿意把 3D 几何理解为连接“重建”与“生成”的脚手架(scaffold):基于学习的大模型为我们提供强大的局部先验,而经典几何帮助把这些局部信息组织成全局一致的 3D 结构。

非常感谢大家的聆听!

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
油价四连跌:9月24日的调价窗口,可能要变卦了

油价四连跌:9月24日的调价窗口,可能要变卦了

沙雕小琳琳
2026-09-23 12:59:28
中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

风干迷茫人
2026-09-23 11:14:24
中午2点!CCTV5直播国足冲击亚运会4强,王钰栋停赛,安东尼奥欲带队再创历史

中午2点!CCTV5直播国足冲击亚运会4强,王钰栋停赛,安东尼奥欲带队再创历史

篮球圈里的那些事
2026-09-23 18:32:44
财政部为什么是党组、公安部为什么是党委?

财政部为什么是党组、公安部为什么是党委?

画生笔记
2026-09-20 09:10:50
日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

史之铭
2026-09-21 17:26:54
4-2横扫张本智和!19岁国乒天才连斩5大世界名将,一战封神

4-2横扫张本智和!19岁国乒天才连斩5大世界名将,一战封神

阿讯说天下
2026-05-30 14:20:24
到底为什么,每次中美峰会前,日本都要抢先去

到底为什么,每次中美峰会前,日本都要抢先去

江平舟
2026-09-22 19:24:25
国足0-0阿联酋,赛后迎2个好消息和1个坏消息,淘汰赛能避开日本

国足0-0阿联酋,赛后迎2个好消息和1个坏消息,淘汰赛能避开日本

侃球熊弟
2026-09-23 15:30:21
美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

扶苏聊历史
2026-09-12 17:43:57
亚运会乒乓球:王楚钦险翻车!决胜局15-13过关,国乒男团1-0领先,林诗栋接场!

亚运会乒乓球:王楚钦险翻车!决胜局15-13过关,国乒男团1-0领先,林诗栋接场!

刘姚尧的文字城堡
2026-09-23 19:44:50
简约半高领无袖上衣,日常居家也能勾勒柔和曲线

简约半高领无袖上衣,日常居家也能勾勒柔和曲线

只要高兴就好
2026-09-23 13:39:54
2分05秒77刷新亚洲纪录,彭旭玮200米仰泳摘金

2分05秒77刷新亚洲纪录,彭旭玮200米仰泳摘金

甜度百分百21
2026-09-22 18:21:50
杀疯了!大跌65%之后今天又一字跌停,两万多股民全线深套!

杀疯了!大跌65%之后今天又一字跌停,两万多股民全线深套!

股侠指北针
2026-09-23 14:49:04
没结果,会谈结束,日本难掩失望,当地时间9月22日,日本首相高市早苗和特朗普的会面草草结束

没结果,会谈结束,日本难掩失望,当地时间9月22日,日本首相高市早苗和特朗普的会面草草结束

扶苏聊历史
2026-09-23 16:33:52
《街霸》春丽演员回应粗大腿"造假":没空P图!

《街霸》春丽演员回应粗大腿"造假":没空P图!

游民星空
2026-09-22 10:11:25
发现一个现象:父母有退休金的家庭,基本上都会有这几种共性!

发现一个现象:父母有退休金的家庭,基本上都会有这几种共性!

小虎新车推荐员
2026-09-23 15:25:02
孙杨也没想到,自己保持了13年的记录,被18岁的张展硕打破了

孙杨也没想到,自己保持了13年的记录,被18岁的张展硕打破了

观锐器
2026-09-22 13:32:20
8分3.5篮板,杨瀚森季前赛证明自己!邓顿:不会为了收视让瀚森上

8分3.5篮板,杨瀚森季前赛证明自己!邓顿:不会为了收视让瀚森上

爱尔爱电影
2026-09-23 14:45:08
加拿大籍华人求助:11岁孩子遭校方警方双重施压停课,走投无路求国人支招

加拿大籍华人求助:11岁孩子遭校方警方双重施压停课,走投无路求国人支招

小徐讲八卦
2026-09-23 07:02:16
战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

体娱一家亲
2026-09-23 17:08:01
2026-09-23 20:39:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

家居
本地
房产
手机
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

手机要闻

小米18 Pro Max手机发布:首发第六代骁龙8超级至尊版,6999元起

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版