茉莉花
新闻网
2026-09-02 · 星期三近12小时收录 110 条最近更新 20:11

快讯雨果奖揭晓:哈罗《永恒》摘长篇 斯卡尔齐系列20年后获奖

李飞飞团队发布Atlas 3到5台手机拍出子弹时间大片

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
爱范儿
原文作者
郑廷旭
原文发布
本站收录

1999 年《黑客帝国》里基努·里维斯仰身躲子弹的那一幕,让「子弹时间」成了影史上最震撼的视觉奇观之一。

图|电影《黑客帝国》经典的「子弹时间」镜头

当年拍摄这个镜头时,剧组在绿幕摄影棚里沿弧线布置了 120 台静态相机,并在阵列两端配置电影摄影机。

相机按照事先设计的时间差依次曝光,让人物动作以极慢速度继续,同时让视角沿着相机阵列移动。后期再通过插帧、数字背景与合成,把这些离散视角接成我们后来熟悉的「子弹时间」。

Image

图|《黑客帝国》「子弹时间」镜头幕后

去年 10 月底的 VOGUE 时尚盛典,现场为了重现这种效果,同样围起了一整圈密不透风的弧形金属支架,上面齐刷刷架着整整 60 台 iPhone 17 Pro,配合 Blackmagic 扩展坞与 Genlock 锁相同步发生器,才拍出了刷屏全网的明星子弹时间大片。

图|VOGUE 盛典上的刘亦菲「子弹时间」

对传统多机位「子弹时间」阵列来说,想获得足够连续的真实视角,最直接的办法始终是把相机铺得足够密。

Image

图|现场由 60 台 iPhone 17 Pro 组成的高密度拍摄阵列(来源:影视飓风)

而李飞飞 World Labs 刚刚发布的 3D 世界模型 Atlas,直接打破了这个规矩。

少掉的 57 台相机,到底被谁「算」没了?

在官方给出的演示里,同样是动态主体的「子弹时间」,现场既没有 60 台手机组成的庞大阵列,也没有复杂的锁相发生器——操作人员只随手在几个不同角度架了 3 到 5 台普通的手机和运动相机,就完成了素材采集。

Image

图|Atlas 生成的子弹时间画面(来源:World Labs)

要想在时间静止的同时移动机位,传统的做法就像小时候玩过的「连点成线」游戏:为了勾勒出一条平滑的圆弧轨迹,过去必须密密麻麻标出 60 个点,连起来才不会显得突兀生硬。

Atlas 彻底改写了这个游戏规则。它不再需要 60 个点,3 到 5 个点就够了。

Image

图|Atlas 使用 3 到 5 个机位即可生成 3D 视角画面(来源:World Labs)

在这个名为「多模态自回归扩散 Transformer」的架构里,Atlas 把文字、图像、深度以及相机位姿(Camera Pose)全都揉进了同一个「空间上下文」。

当操作人员把几台手机从不同角度拍到的视频丢给模型时,每一帧画面都带着明确的三维空间坐标。

凭借这几个真实的稀疏视角(Sparse Views),模型在统一的空间上下文里维持不同视角之间的几何一致性,并推断、生成输入没有覆盖的区域。

图|World Labs

这个空间上下文的胃口很大:静态场景通常只要 2 到 3 张照片就能完成基础重建,而如果需要更精细的细节,它也能一口气吃下上百张图片。给的真实视角越多,模型对空间的理解就越扎实。正如 World Labs 的技术博客:

它看见的越多,需要「想象」的就越少。

The more it sees, the less it imagines.

在镜头拍到的地方,Atlas 会尽量保持内容与几何的一致;而物体背面、遮挡区等没有被摄影机记录的位置,则根据训练中学到的世界先验生成一个「合理的答案」。

进可重构特写,退可俯瞰全场

看到这里,你可能多少也有点好奇:如今的视频模型也能生成环绕运镜,Atlas 和输入一句「生成一段摄影机围绕主体旋转的视频」有什么区别?

去年 APPSO 针对 VOGUE 子弹时间的复刻实验中,我们就曾用一张库里投篮的高清照片输入给视频生成模型,通过 Prompt 提示词成功模拟出了一段相当流畅的环绕运镜。

图|爱范儿/APPSO 此前使用可灵 AI 模拟的子弹时间环绕效果

这种基于单图和提示词的生成方式非常惊艳,也很适合快速创作。不过从精确控制的角度来看,它与 Atlas 走的其实是两条截然不同的技术路线:

主流视频生成模型是在二维像素层面,根据文本语义去推演「一段看起来像是在旋转拍摄的视频」,镜头的运动轨迹、转速和景深关系更多依赖模型自主发挥;

而 Atlas 最大的质变,在于它把摄影机位姿(Camera Pose)做成了模型的原生几何输入参数。

Image

图|Atlas 原生支持 Camera Pose 精确控制虚拟摄影机在空间中的环绕轨迹(来源:World Labs)

这意味着你不用再靠提示词碰运气,费劲地让 AI「把镜头往左上方拉一点」;你可以像在 3D 软件里排布机位一样,直接给虚拟摄影机设定精确的运动轨迹。

更关键的是,这些轨迹坐标与现实空间是严格对应的——现场相机在哪个位置,虚拟镜头移到什么距离,Atlas 都能更明确地对齐。

Image

图|拍摄完成后通过世界模型事后生成的高空俯视全新机位(来源:World Labs)

普通 AI 视频是在 2D 画布上「出运镜的感觉」;而 Atlas 是先在神经网络内部构建起一个具有空间与时间连续性的三维世界,再派一台受你完全操控的虚拟摄影机进入这个世界去重新取景

当摄影机机位真正变成一个可自由调节的参数,整个摄影的规则就被改写了。如果把视线放宽到整个影像技术的发展史,你会发现一部摄影史,本质上就是「现场拍摄决策不断向后期推迟」的历史:

百年前的胶片时代,摄影师需要在拍摄现场完成大量关键决定,对焦、机位、快门时机尤其难以后期挽回,曝光和色彩虽然也有暗房调整空间,但容错远没有今天这么高;

进入数码时代后,RAW 格式让我们可以在拍摄后随意调整白平衡和曝光;计算摄影与多摄系统的普及,让我们可以在拍完照片后再重新模拟光圈虚化与景深;

而 Atlas 把这种「后期自由度」推向了最核心的机位:拍摄结束后,摄影师不仅能自由切换角度,甚至可以在电脑里凭空调出一个现场根本不存在的「上帝视角」——去俯瞰整个场景,或者拉近重构一个细节特写。

Image

图|拍摄完成后重新调整特写景别与运镜轨迹(来源:World Labs)

这种拍完后再选机位的体验,有些似曾相识——这不就是《赛博朋克 2077》里的「超梦」吗?进入编辑模式后,视角不再受限于原本的第一人称,玩家可以在凝固的时空里自由移动镜头,重新审视整个现场。

Image

图|《赛博朋克 2077》的「超梦」编辑模式,玩家可以在记录结束后自由移动镜头(截图:Interface In Game)

Atlas 就像是把这种科幻设定带进了现实。或许在不久的未来,普通人也能体验到类似「超梦」的感觉:现场随手用手机记录片刻,事后便能真正「走入」那段三维记忆,从任意角度重新取景与回味生活。

从看懂一张二维照片,到理解整个三维世界

子弹时间只是 Atlas 展现在大众面前最酷炫的切面。在 World Labs 的蓝图里,这套能力最终要通向的,是一个更宏大的命题:空间智能(Spatial Intelligence)。

在推断时,Atlas 不仅能输出最终的视频像素,还能同步导出稠密深度图(Depth)、三维点云(Point Cloud)以及 3D Gaussian Splat。

它会先预测每一帧的深度,拼出场景的三维骨架(点云)、补全没有被摄影机覆盖的区域,并转换成完整的 3D Gaussian Splat 场景,最终生成可以在设备上实时渲染、自由穿梭的数字空间。

Image

图|Atlas 把生成的新视角和深度估计转成点云,再生成可实时渲染的 Gaussian Splat(来源:World Labs)

今年 2 月,World Labs 宣布完成 10 亿美元新融资;7 月,公司又收购了机器人与仿真公司 SceniX。在技术阐述中,他们反复强调了一个核心概念:Real-to-Sim-to-Real(真实 → 仿真 → 真实)。

对于目前火热的具身智能(Embodied AI)与人形机器人来说,一个关键瓶颈是如何低成本、规模化地获得足够丰富的训练经验和评测环境。真实机器人每一次试错都会占用硬件、人工和场地,而且很多罕见情况难以在现实中反复复现。

有了 Atlas,模型仅凭几条现场视频就能重建出逼真的数字孪生世界。算法可以让虚拟机器人在这个环境里随意规划导航路线、推演机械臂抓取,甚至自由更改物体的摆放、光照和背景,以极低的成本生成近乎无限的机器人训练数据。

Image

图|Atlas 的 Real-to-Sim 演示:从稀疏实拍重建场景,再改变机器人、物体、光照和背景(来源:World Labs)

从当年创建 ImageNet 开启深度学习图像识别浪潮,到如今创立 World Labs 探索空间智能,李飞飞的研究主线始终清晰:

从前是教电脑「看懂一张二维照片里有什么」;现在是教电脑「理解一个三维空间里的物理规律、几何关系以及下一秒会发生什么」。

当年,《黑客帝国》靠上百台相机硬生生围出子弹时间;如今,几台手机配合一个世界模型就能重建出鲜活的三维时空。技术的每一次跃升,都在把创作从沉重的设备中解救出来。

当物理机位不再成为灵感的阻碍,决定镜头方向的,永远是创作者想要讲述的故事。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]