智讯智库

张一鸣亲自挂帅!字节跳动押注世界模型,最快10月推出实时空间视频AI

原创AI
来源许倍
2026年09月08日13:41
分享
收藏
字体大小

据彭博社9月7日援引知情人士报道,字节跳动正准备推出一款实时空间视频生成模型,由创始人张一鸣亲自督导这款新模型的研发工作,产品最快可能于10月推出。

该模型基于字节跳动现有的电影级视频生成AI模型Seedance构建,将允许用户面向直播、短剧和游戏创建交互式虚拟世界,并计划服务于Pico VR头显。

张一鸣已离开字节跳动的日常管理多年。但这一次,他亲自挂帅,协调模型、云端、设备和内容等不同业务部门,向该项目投入AI资源和计算能力。

知情人士称,张一鸣将空间视频模型定位为驱动整个生态的「飞轮」——该模型能够将用户置于高度沉浸的三维虚拟环境中,功能与谷歌的Genie类似。字节跳动得以将其自研AI模型、云计算底层资源,与旗下的内容平台以及XR业务分支Pico的硬件终端深度串联、协同发力。

字节的这一动作并非凭空而来。据36氪此前报道,字节跳动为2026年设定了四项AI优先事项,世界模型排在首位,其余三项分别是保持Seedance的视频生成优势、提升编码能力和推进豆包商业化。其中。世界模型方向的数据预算达到八位数人民币,是国内竞争对手的三到四倍。

彭博社将字节的这一项目放在全球世界模型赛道中观察,认为字节此举意在与Meta和Google展开直接竞争。张一鸣的参与使他与李飞飞和闫乐存等研究人员并肩而立,这些研究人员认为,基于视觉和物理理解(而不是仅仅基于语言)的世界模型才是AI能够在现实世界中行动的系统道路。

世界模型是一个能够充分学习环境行为方式,从而渲染出一个能够对用户在其中的操作做出连贯响应的环境的系统。它被视为生成式AI的下一个战场——从生成一段内容,走向构建一个用户可以踏入其中、与之互动的数字环境。

与传统“先渲染后观看”的视频生成不同,空间视频需要跟着用户一起动:向前走,眼前的视角推进;转过身,还能看到连贯的四周;说话或做出动作,系统跟着回应。前后画面还得接得上,否则每次改变视角,用户面对的可能就是另一个场景。

Seedance已有的视频生成能力可以作为基础,但持续互动又增加了新的要求。抖音和TikTok积累的大量现实世界影像,被认为是字节进入这一领域的潜在数据优势——视频里记录着物体移动、人物行动和环境变化,正是世界模型需要学习的视觉信息。

目前,字节跳动未回应彭博社的置评请求。截至发稿,该项目具体上线时间和产品形态尚未官方确认。

最新发布