茉莉花
新闻网
2026-09-11 · 星期五近12小时收录 58 条最近更新 06:28

快讯中国四地包揽PISA科学数学第一 官方为何低调

蚂蚁灵波开源1.3B世界模型 单卡GPU可实时生成

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
量子位
原文发布
本站收录

金磊 发自 凹非寺

量子位 | 公众号 QbitAI

大火的世界模型,真的不能拿一张消费级显卡跑吗?

有的,家人们,真的有的。

因为就在刚刚,一个国产的、开源的世界模型,做到了!

来,先来看一下第一人称射击效果:

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q

在雪地科幻场景里,角色一边移动和转动视角,一边开火,过程中还能看到爆炸、火焰、能量护盾等反馈。

重点是这些变化都发生在同一个持续生成的世界里,场景也会随着操作继续往前走。

再来看大热的《奥德赛》的场景:

e02a730aa69af3e742579f06a058ce6d5321c16e94e70a272bcb013032765a64 article

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q

这次是第三人称视角,角色在巨型木马、城墙和火光之间向前探索。随着角色不断移动,近处的人物、地面和远处建筑也在持续展开,整个场景的空间关系基本能一直维持下来。

再换一个完全不同的风格:

0d304a1f42e62b47bda2ec317aeed930b3e278fc1f7a313096c7c2d8e9099af9 article

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q

三个Demo,三种完全不同的世界。

而跑出这些效果的,就是蚂蚁灵波在 7 月开源的LingBot-World 2.0

而刚刚,他们又发布了 LingBot-World 2.0 的轻量版,参数规模只有1.3B。是面向消费级单卡GPU设计、可以在本地实现实时世界生成的那种。

33b395ee5a3de274a5b90a770d42b3bfa9821e580a74d285b56ef14ed24f1478 article

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q

LingBot-World 2.0在今年7月开源的是14B主模型。这套世界模型已经能做到小时级持续生成、丰富的动作和事件交互,并在相应算力和推理配置下实现720p/60fps的高清实时体验。

彼时,“1.3B”这个数字,就已经悄悄出现在了论文摘要里。

8eb4a5d47e4c2f4eabe6debc133c5236c58feebff393b161f2f088b9f26fcce0 article

而且就在上周的IFA柏林消费电子展开幕演讲上,这个伏笔又被公开点了一次。

在开幕演讲中,AMD高级副总裁Jack Huynh一共点名了 3 个开源模型,除了智谱、千问,就是LingBot-World。他拿LingBot-World 2.0做了Demo。一个Prompt生成世界之后,角色可以在中国小镇、欧洲乡村等环境里长时间探索、环顾和行动,场景还会随着交互继续向前展开。

Jack Huynh看完之后给了一句评价:

This is the future of Personal AI.

6e8a98437a619999d080aa5c543ed83e74e17e5957aa5440ffdbddc9ab4c5be2 article

一切的承诺,今天,均已兑现。

但比起又一个开源这个动作来说,我们或许更好奇的是——

能本地实时跑起来的世界模型,到底是怎么做到的?

要回答这个问题,得先从世界模型和普通视频生成的区别说起。

平时我们用AI生成一段视频,输入Prompt之后,等几十秒甚至几分钟都很正常。模型把整段视频生成完,再把结果交到你手里,事情基本就结束了。

但世界模型显然不是这么干的。人在场景里往前走一步,模型就得接着往前生成;视角转向左边,画面也得跟着变化……换句话说,世界模型是在生成一个持续演进的世界

虽然7月的LingBot-World 2.0已经把这件事做到了一个相对不错的效果,例如做过超过一小时的不间断生成测试,从水乡、城市一路跑到雪地、太空等不同场景,整个过程中,模型都能维持比较稳定的场景结构和视觉质量。

edc7c3a5c3966498db79e2c76cf0295ab7c818e5893540ffd4eb9cb84644c2fa article

但这一套体验的背后,工程栈也是相当繁重的。

蚂蚁灵波在部署层面堆了编译器级别的注意力Kernel优化、动态KV缓存调度、异步流媒体传输,还有混合并行推理策略等……为的是让高质量的实时世界能先跑起来。

于是在今天之前,绝大多数人接触世界模型的方式其实只有两种:看官方放出来的视频,或者去在线Demo页面点两下。

所以1.3B版本想要解决的问题是,能不能在较少的算力情况下,也把它跑起来。

不过从14B到1.3B,蚂蚁灵波并非是先做出大模型然后再砍小,而是先把一条训练路线走通,小模型是这条路线走到最后自然出现的产物。

为此,蚂蚁灵波团队首先训练了一个叫Causal World的模型。所谓Causal,可以简单理解成,模型生成当前状态时,只能依赖过去已经发生的视觉信息,以及用户到此刻为止给出的输入,未来还没发生的内容不能提前看,即为因果。

但在这个过程中,自回归模型会把自己刚刚生成出来的结果继续当成后面的输入。前面只要稍微偏一点,这个误差就有可能一路被带到后面。生成时间拉长之后,纹理会变糊,几何结构会逐渐变形,整个场景甚至可能慢慢漂掉。

为了让Causal Pretrain阶段的模型在长上下文里保持住生成质量,LingBot-World 2.0又设计了MoBA,也就是Mixture of Bidirectional and Autoregressive Attention Mask。

它主要解决的是纯Teacher Forcing在长上下文里容易出现的另一个问题。随着上下文越来越长,模型会越来越依赖前面已经给出的干净Context,最后容易出现过拟合,视觉质量也会跟着下降。

MoBA在原有Teacher Forcing Mask里加入一部分双向Attention,相当于给训练过程增加一层正则,让模型适应更灵活的视频长度,同时缓解这种过拟合和画质退化。

c594fd4c4a945dc56e9404e17a7d6e3c333e93821c8f6ba4b63c6f8b8f38e29a article

这一阶段训练出来的Backbone,先把世界模型的基础能力撑了起来。

团队后来还专门拿这个Causal Pretrained Backbone和MAGI、HY-World 1.5做过长时生成对比。从5秒到60秒,LingBot-World 2.0在纹理、几何结构和场景连贯性上的保持更加稳定。

9edc342dae7cccdaa0cf08a04e33900b97797907625493677c52cf2bbbd1bd3d article

但高质量的Backbone还有一个很现实的问题:慢。

这个经过因果预训练的Backbone,同时也承担Teacher的角色。Teacher可以给出质量更高的生成结果,但每一帧都需要经过很多步去噪,如果直接拿去做实时交互,计算成本还是太高。

所以接下来,LingBot-World 2.0开始做蒸馏。

第一步是一致性蒸馏,也就是Consistency Distillation。它把Teacher原本需要很多步才能走完的去噪轨迹压缩到少数几步,让Student用更少的计算完成生成,同时尽量保留预训练阶段已经学到的动作条件动态能力。

不过Student真正部署出去以后,面对的大量状态都来自它自己上一轮的生成。前面只要出现偏差,后面还是有可能继续放大。

于是团队又在这一步加入了DMD,也就是Distribution Matching Distillation,并且专门让Student在自己的长时self-rollout轨迹上继续训练。

换句话说,模型以后真正会跑进什么状态,训练时就先让它提前见过。这种训练方式可以减少长时自回归过程里的累计漂移。

到这里,整条路线才算真正接了起来。

LingBot-World 2.0先用Causal Pretrain打下一个长时生成相对稳定的世界模型底座,再让Teacher提供高质量的生成过程,随后通过蒸馏把原本需要多步完成的计算压缩到少步,最后再让Student去适应自己真正运行之后会遇到的状态。

所以从表面看,这次只是又多了一个小尺寸版本。往深一层看,蚂蚁灵波实际上把LingBot-World 2.0的研发链路也往外开放了一截。

若是我们把时间往前倒一点,就不难发现LingBot-World这一年的变化几乎一直围绕两个字展开——门槛

  • 今年1月,LingBot-World 1.0第一次开源;
  • 到了7月,LingBot-World 2.0来到14B,开始挑战小时级持续生成、复杂事件交互和720p/60fps实时体验;
  • 今天,1.3B版本又把同一套世界模型往消费级单卡上推了一步。

三次开源,依次回答的其实是三个问题:

能不能做出来,能不能做得久、做得真,以及能不能让更多人跑起来。

而这次蚂蚁灵波把Causal Pretrain和双向Teacher一起放出来,走的也是同一个逻辑。

小模型负责让更多人把世界模型跑起来。这两个上游模型管的是跑起来之后,社区能不能接着往下改,做后训练、做蒸馏、做压缩、做垂直场景适配。

因此,如果说世界模型的上半场,比的是能不能生成得更久、更真;那么下半场要比的,可能是能不能让普通人手上那张卡也跑得动。

这个规律在AI发展的过程中其实已经重复过好几回了。真正让一项技术扩散开的,往往不是最强的那个版本,而是第一个足够小、足够便宜、能被拿来试一试的版本。

最后,如果说世界模型一直在尝试把AI装进一个可以无限延展的世界里。

那么现在,当门槛被打下去之后,这个世界终于开始装得进普通人的显卡了。

官网:

https://technology.robbyant.com/lingbot-world-v2

模型:

https://huggingface.co/collections/robbyant/lingbot-world-v2

代码:

https://github.com/robbyant/lingbot-world-v2

论文:

https://arxiv.org/pdf/2607.07534

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]