9月8日消息,据彭博社报道,字节跳动正在开发一款用于实时空间视频生成的AI模型,最早可能下个月就会推出。
其中一位知情人士提醒说,具体时间尚未确定,计划可能会有所变动。
字节跳动发言人未回复彭博社的置评请求。
报道称该模型将基于字节跳动现有的视频生成系统 Seedance 构建,使用户能够创建用于直播、短剧和游戏的交互式虚拟世界。
该模型可以按需提供视频,帧率约为每秒 20 帧,延迟约为 0.05 秒,视频在云端生成,而不是在设备上生成。
最后一个细节就是策略。远程渲染空间内容可以减轻头显的计算负担,从而降低硬件的处理能力,进而降低成本。
字节跳动旗下拥有 Pico,这是其扩展现实部门。据报道,该模型旨在生成能够对 Pico 用户的声音和动作做出反应的世界。
如果成功,XR 领域的竞争将从硬件规格转向模型、云容量和内容分发,而这三方面字节跳动已经拥有。
这一切并非凭空而来。36氪今年早些时候报道称,字节跳动已为2026年设定了四大人工智能发展重点,其中世界模型位列榜首,其次是保持seedance在视频领域的领先地位、改进代码以及实现豆包的商业化。
同一份报告明确设定了目标:在年底前发布至少一个世界模型,模型性能达到现阶段世界模型全球 SOTA(最佳)Google Genie 3 的水平。
2026年初的内部测试显示,字节跳动在同一方面仍落后全球最先进水平约10%。如果下个月发布,则比原计划提前了。
据36氪报道,该公司正在同时推进两条路线:一是面向具身智能和机器人的视觉-语言-动作方法,二是面向娱乐和游戏的 3D 模拟。
空间视频模型属于第二种,这种模型也已经拥有了一定的用户基础。
![]()
世界模型,就目前大家所使用的意义上而言,是一个能够充分学习环境行为方式,从而渲染出一个能够对用户在其中的操作做出连贯响应的环境的系统。
视频公司之所以不断投资于这个领域,是因为模型训练材料本身就是视频,而那些拥有最多视频素材,并且最有经验将其压缩成快速渲染格式的公司,则拥有一个独特的优势。
目前,一些以娱乐产品为主要产品的公司正在对这种案例进行商业测试。
资金实力毋庸置疑。据彭博社报道,字节跳动上周获得了300亿美元的贷款,并且一直在考虑斥资高达700亿美元用于人工智能领域的建设。
Seedance 已经为 CapCut 和豆包提供了技术支持,而且就其国内市场而言,该公司仍然是阿里巴巴、DeepSeek 和 月之暗面 的有力竞争者。
对 Meta 和苹果来说,这种影响并非立竿见影,而是令人尴尬。两家公司都在头戴式设备领域投入巨资,但这些设备并未成为主流。
来源 | AI普瑞斯(ID:AIPress2025)
作者 | AI普瑞斯 ; 编辑 | 虾饺
内容仅代表作者独立观点,不代表早读课立场
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.