金磊 发自 凹非寺
量子位 | 公众号 QbitAI
大火的世界模型,真的不能拿一张消费级显卡跑吗?
有的,家人们,真的有的。
因为就在刚刚,一个国产的、开源的世界模型,做到了!
来,先来看一下第一人称射击效果:

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q
在雪地科幻场景里,角色一边移动和转动视角,一边开火,过程中还能看到爆炸、火焰、能量护盾等反馈。
重点是这些变化都发生在同一个持续生成的世界里,场景也会随着操作继续往前走。
再来看大热的《奥德赛》的场景:

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q
这次是第三人称视角,角色在巨型木马、城墙和火光之间向前探索。随着角色不断移动,近处的人物、地面和远处建筑也在持续展开,整个场景的空间关系基本能一直维持下来。
再换一个完全不同的风格:

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q
三个Demo,三种完全不同的世界。
而跑出这些效果的,就是蚂蚁灵波在 7 月开源的LingBot-World 2.0。
而刚刚,他们又发布了 LingBot-World 2.0 的轻量版,参数规模只有1.3B。是面向消费级单卡GPU设计、可以在本地实现实时世界生成的那种。

视频地址:
https://mp.weixin.qq.com/s/fOoXddwWjKixTbrMQiyd8Q
LingBot-World 2.0在今年7月开源的是14B主模型。这套世界模型已经能做到小时级持续生成、丰富的动作和事件交互,并在相应算力和推理配置下实现720p/60fps的高清实时体验。
彼时,“1.3B”这个数字,就已经悄悄出现在了论文摘要里。

而且就在上周的IFA柏林消费电子展开幕演讲上,这个伏笔又被公开点了一次。
在开幕演讲中,AMD高级副总裁Jack Huynh一共点名了 3 个开源模型,除了智谱、千问,就是LingBot-World。他拿LingBot-World 2.0做了Demo。一个Prompt生成世界之后,角色可以在中国小镇、欧洲乡村等环境里长时间探索、环顾和行动,场景还会随着交互继续向前展开。
Jack Huynh看完之后给了一句评价:
This is the future of Personal AI.

一切的承诺,今天,均已兑现。
但比起又一个开源这个动作来说,我们或许更好奇的是——
能本地实时跑起来的世界模型,到底是怎么做到的?
要回答这个问题,得先从世界模型和普通视频生成的区别说起。
平时我们用AI生成一段视频,输入Prompt之后,等几十秒甚至几分钟都很正常。模型把整段视频生成完,再把结果交到你手里,事情基本就结束了。
但世界模型显然不是这么干的。人在场景里往前走一步,模型就得接着往前生成;视角转向左边,画面也得跟着变化……换句话说,世界模型是在生成一个持续演进的世界。
虽然7月的LingBot-World 2.0已经把这件事做到了一个相对不错的效果,例如做过超过一小时的不间断生成测试,从水乡、城市一路跑到雪地、太空等不同场景,整个过程中,模型都能维持比较稳定的场景结构和视觉质量。

但这一套体验的背后,工程栈也是相当繁重的。
蚂蚁灵波在部署层面堆了编译器级别的注意力Kernel优化、动态KV缓存调度、异步流媒体传输,还有混合并行推理策略等……为的是让高质量的实时世界能先跑起来。
于是在今天之前,绝大多数人接触世界模型的方式其实只有两种:看官方放出来的视频,或者去在线Demo页面点两下。
所以1.3B版本想要解决的问题是,能不能在较少的算力情况下,也把它跑起来。
不过从14B到1.3B,蚂蚁灵波并非是先做出大模型然后再砍小,而是先把一条训练路线走通,小模型是这条路线走到最后自然出现的产物。
为此,蚂蚁灵波团队首先训练了一个叫Causal World的模型。所谓Causal,可以简单理解成,模型生成当前状态时,只能依赖过去已经发生的视觉信息,以及用户到此刻为止给出的输入,未来还没发生的内容不能提前看,即为因果。
但在这个过程中,自回归模型会把自己刚刚生成出来的结果继续当成后面的输入。前面只要稍微偏一点,这个误差就有可能一路被带到后面。生成时间拉长之后,纹理会变糊,几何结构会逐渐变形,整个场景甚至可能慢慢漂掉。
为了让Causal Pretrain阶段的模型在长上下文里保持住生成质量,LingBot-World 2.0又设计了MoBA,也就是Mixture of Bidirectional and Autoregressive Attention Mask。
它主要解决的是纯Teacher Forcing在长上下文里容易出现的另一个问题。随着上下文越来越长,模型会越来越依赖前面已经给出的干净Context,最后容易出现过拟合,视觉质量也会跟着下降。
MoBA在原有Teacher Forcing Mask里加入一部分双向Attention,相当于给训练过程增加一层正则,让模型适应更灵活的视频长度,同时缓解这种过拟合和画质退化。

这一阶段训练出来的Backbone,先把世界模型的基础能力撑了起来。
团队后来还专门拿这个Causal Pretrained Backbone和MAGI、HY-World 1.5做过长时生成对比。从5秒到60秒,LingBot-World 2.0在纹理、几何结构和场景连贯性上的保持更加稳定。

但高质量的Backbone还有一个很现实的问题:慢。
这个经过因果预训练的Backbone,同时也承担Teacher的角色。Teacher可以给出质量更高的生成结果,但每一帧都需要经过很多步去噪,如果直接拿去做实时交互,计算成本还是太高。
所以接下来,LingBot-World 2.0开始做蒸馏。
第一步是一致性蒸馏,也就是Consistency Distillation。它把Teacher原本需要很多步才能走完的去噪轨迹压缩到少数几步,让Student用更少的计算完成生成,同时尽量保留预训练阶段已经学到的动作条件动态能力。
不过Student真正部署出去以后,面对的大量状态都来自它自己上一轮的生成。前面只要出现偏差,后面还是有可能继续放大。
于是团队又在这一步加入了DMD,也就是Distribution Matching Distillation,并且专门让Student在自己的长时self-rollout轨迹上继续训练。
换句话说,模型以后真正会跑进什么状态,训练时就先让它提前见过。这种训练方式可以减少长时自回归过程里的累计漂移。
到这里,整条路线才算真正接了起来。
LingBot-World 2.0先用Causal Pretrain打下一个长时生成相对稳定的世界模型底座,再让Teacher提供高质量的生成过程,随后通过蒸馏把原本需要多步完成的计算压缩到少步,最后再让Student去适应自己真正运行之后会遇到的状态。
所以从表面看,这次只是又多了一个小尺寸版本。往深一层看,蚂蚁灵波实际上把LingBot-World 2.0的研发链路也往外开放了一截。
若是我们把时间往前倒一点,就不难发现LingBot-World这一年的变化几乎一直围绕两个字展开——门槛:
三次开源,依次回答的其实是三个问题:
能不能做出来,能不能做得久、做得真,以及能不能让更多人跑起来。
而这次蚂蚁灵波把Causal Pretrain和双向Teacher一起放出来,走的也是同一个逻辑。
小模型负责让更多人把世界模型跑起来。这两个上游模型管的是跑起来之后,社区能不能接着往下改,做后训练、做蒸馏、做压缩、做垂直场景适配。
因此,如果说世界模型的上半场,比的是能不能生成得更久、更真;那么下半场要比的,可能是能不能让普通人手上那张卡也跑得动。
这个规律在AI发展的过程中其实已经重复过好几回了。真正让一项技术扩散开的,往往不是最强的那个版本,而是第一个足够小、足够便宜、能被拿来试一试的版本。
最后,如果说世界模型一直在尝试把AI装进一个可以无限延展的世界里。
那么现在,当门槛被打下去之后,这个世界终于开始装得进普通人的显卡了。
官网:
https://technology.robbyant.com/lingbot-world-v2
模型:
https://huggingface.co/collections/robbyant/lingbot-world-v2
代码:
https://github.com/robbyant/lingbot-world-v2
论文:
https://arxiv.org/pdf/2607.07534
— 完 —
量子位 QbitAI · 头条号
关注我们,第一时间获知前沿科技动态
更新时间:2026-09-11
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号