
今天看到一则新闻,先想到的是一则旧闻。
2023年10月,Pico的负责人据报道飞了一趟新加坡。
| 亿欧当时援引知情人士的说法称,他去向张一鸣汇报工作,带回来的反馈是字节将逐步放弃Pico,理由是硬件并非字节所长,几年下来成绩未达预期,看不到未来。字节相关负责人随后否认,称Pico正常运营,公司会长期投入XR业务。那次汇报究竟说了什么,外界没有得到经过确认的答案。
不到三周,11月7日上午十点,Pico召开全员会。会议持续不足十分钟。周宏伟宣布收缩市场、内容、视频等团队,移动OS团队并入字节研发中台。据《晚点》报道,调整后团队将从两千人缩至一千人左右。周宏伟承认,对行业和市场的发展估计得过于乐观。
三年后的如今,张一鸣与Pico再次出现在同一条新闻里。

9月7日,彭博社援引知情人士称,字节正在基于Seedance开发实时空间视频生成模型,张一鸣亲自督导,协调业务部门,调配AI资源与算力,最快10月发布,计划仍可能调整。模型面向直播、短剧和游戏,并计划与Pico打通。但字节至今并未独此回应。
但不管如何,我们很容易将这条新闻读成创始人回来挽救一笔旧投资。毕竟Pico提供了足够完整的戏剧条件:高额投入、业务收缩,以及一次重新出发的机会。
然而,若沿着“头显”继续写下去,会将张一鸣正在参与的事情越写越小。
| 我认为这次需要重新估值的,是字节的视频能力。
01
五十毫秒之外
彭博披露的技术参数有两个:约0.05秒延迟,每秒20帧。
这两个数字回答了生成速度的问题。世界模型还有一道更难的考题:生成出来的环境,能不能持续承接行动的后果。
| 一段视频可以把汽车驶过路口的过程表现得很逼真,但用于驾驶仿真的世界模型,还要处理另一种要求:在同一个路口,车辆提前刹车、继续加速、临时变道,分别会发生什么?
记录中的道路只被走过一次,模型却需要回应多种尚未发生的选择。
| 这正是世界模型的重要价值。Google的官方介绍中,将此类模型的任务概括为模拟环境如何演变,以及行动如何影响环境。视频生成是实现这项能力的一条路线,世界模型也可以在内部表征中进行预测,并不都需要向用户展示一段画面。
因此,实时空间视频生成的技术分量,不能只按画质和帧率来称重。
用户改变方向后,场景能否保持一致?已经移动的物体,能否留在新的位置?一连串操作之后,模型还能不能记住此前发生了什么?这些能力决定生成过程能否成为一个持续运行的环境。
相关研究已经将误差累积和记忆不足,列为交互视频世界模型的关键难题。画面可以一帧接一帧地生成,环境却可能在连续推演中逐渐失去一致性。
| 截至此次媒体报道,字节这款模型的完整技术报告、长时交互表现和物理一致性评测,尚未在所查公开资料中找到。仅凭五十毫秒,既无法判定产品已经成熟,也不足以判断世界模型能力领先或落后。

▲ 此图由AI辅助制作
但可以确定,字节正在尝试把Seedance推进到一项更重的任务里。
一段成片交付后,生成工作可以结束。一个交互环境启动后,模型还要对下一次行动负责。
02
视频,是字节的入场券
36氪《智能涌现》在今年6月报道中,把世界模型列在字节2026年四项AI重点的第一项,其余三项是视频模型、Coding和豆包商业化。报道援引知情人士称,世界模型训练数据预算达到数千万元;一名供应商估计,投入可达其他厂商的三到四倍。这些属于媒体信源披露,并非字节公布的预算。
钱花在哪里,比优先级排在哪里更能说明问题。
| 世界模型需要从观察中积累关于空间、运动和交互的知识。视频恰好把这些信息压在同一种载体里:镜头移动会暴露空间结构,物体运动包含动力学线索,遮挡与重现则要求模型理解画面之外仍然存在的东西。
这给视频模型留下了一条向世界模型延伸的路径。2024年的Genie研究,已经展示过从没有真实动作标签的互联网视频中学习潜在动作,并生成可控制环境的可能性。
字节从Seedance出发,有明确的技术依据。视频模型积累的表征、训练方法和生成能力,都有机会成为下一阶段的基础。

不过,短视频平台拥有大量视频,与研究团队拥有适合训练世界模型的数据,中间仍有距离。
剪辑可以省略过程,转场可以掩盖空间关系,镜头外的动作也未必被记录。模型看见物体移动,未必知道推动物体的力有多大;看见一个结果,也未必掌握足够信息去预测另一种操作的结果。
视频规模提供了学习材料,数据的结构与质量泽决定这些材料能教会模型什么。
| 从这个角度看,字节选择直播、短剧和游戏作为落地方向,相当合理。
这些场景与视频生成能力相邻,也允许产品先在有限的动作范围、有限的交互时长和特定规则下运行。模型无须在第一天就回答真实世界里的所有物理问题。
| 按这条路线推演,字节可以先找到用户愿意消费的交互体验,持续优化生成速度、运行成本和控制能力,再检验其中哪些能力能够迁移到更复杂的任务。
这是一条有商业需求支撑的研究路线。
但商业需求只能帮助研究继续,不能替研究证明成功与否。
03
另一种玩家
若想理解世界模型的行业位置,可以看一眼Google的游戏演示。
| 2025年11月,Google DeepMind公布SIMA 2。研究团队把这个智能体放进Genie 3临时生成的环境,让SIMA 2理解指令、辨认周围环境,并采取行动完成目标。Google还报告了智能体在生成环境中通过自身经验继续改善表现的实验。

屏幕上依然是一个可探索的世界,坐在屏幕前的玩家已经换成AI。
这个变化,将世界模型的需求从娱乐扩展到了训练。
智能体负责选择行动,世界模型负责模拟行动之后的环境。两者接在一起,AI就有机会在大量可生成的情境中尝试、犯错、获得反馈。环境的多样性、可控程度和可靠性,会直接影响这些经验的价值。
| 到2026年2月,Waymo又把这条路线向驾驶领域推进了一步。Waymo公布的世界模型基于Genie 3,经过面向驾驶场景的专门适配,可以按驾驶动作、场景布局和语言指令控制仿真,同时生成摄像头与激光雷达数据。
同一套基础能力,开始承接不同的专业要求。视频中的广泛视觉知识,需要经过领域训练,才能进入车辆真正使用的传感器与控制体系。
英伟达也在沿着这条产业链布局。2026年5月公布的Cosmos 3,把视觉推理、世界生成和动作预测放进同一系统,应用方向包括合成数据、物理AI训练和评测。

这些动作共同指向一个变化:世界模型,正在被争夺为AI的训练与运行基础设施。
内容创作者需要生成一场雨,驾驶团队需要知道不同雨量如何影响一次驾驶任务。两种需求可能共享部分模型基础,但两类客户花钱买的东西,并不一样。
| 前者购买创作效率,后者购买可用于训练和验证的经验。
这也解释了为何不能将字节的项目局限在“让观众走进短剧”上。娱乐只是已经被点名的市场,世界模型背后的能力竞赛,则宽得多。
04
流量换不来的东西
沿着这条产业趋势,字节最有吸引力的筹码,也最容易被高估。
直播、短剧和游戏,可以为模型提供真实用户、交互需求,以及持续出现的问题。哪里响应太慢、什么动作经常失控、怎样的场景容易失去一致性……都有机会在使用中暴露。
| 如果字节建立起有效的数据采集、筛选和训练机制,这些反馈能够支持产品与模型迭代。
但必须分清,用户的反馈在验证什么。
用户喜欢一个生成结果,可以说明画面有吸引力;用户愿意继续玩,可以说明交互有趣。这两种信号,都不能直接证明模型准确预测了真实世界的变化。
假设玩家按下按钮,模型生成了一座倒塌的桥。操作与画面之间确实建立了联系。但这段交互记录本身,无法证明桥梁为什么倒塌、应该怎样倒塌,更不能直接用于验证现实中的结构安全。
模型生成的结果,需要外部依据来校准。否则,大规模互动,也可能只是为模型已有的偏差增加更多样本而已。
| 世界模型因此面对两种不同的进步:更善于满足人的感官与意图,以及更准确地预测环境变化。两条路线可以互相帮助,却不会因为共用一个模型名字就自动合并。
Waymo的案例里值得留意的,正是专门适配、多传感器输出与驾驶动作控制这些工作。通用视觉知识提供起点,专业数据与验证决定后续用途。

当然,字节也并非只有视频这一条线。官方公开的Seed3D 2.0涉及场景布局、部件拆分和可动结构生成,以便把3D资产接入物理与图形引擎;Seed模型目录中,还列有面向机器人操作的GR-3与GR-RL。
| 这些布局说明,字节已经在积累视频之外的能力。但资产生成、机器人策略与此次实时视频模型,不能被直接写成一套已经打通的系统。
接下来值得观察的,就是这些能力能否发生实质联系:生成环境能否帮助智能体完成更多任务?训练收益能否迁移到新的环境?进入真实设备之后是否依然有效?
对字节而言,娱乐业务可以提供一块有收入潜力的试验场。但能否从这块试验场走向更通用的世界模型,还取决于公司还愿意补多少流量无法替代的功课。
05
字节要争哪一层?
| 彭博报道中,还有一句容易被头显夺走注意力的话:字节正在把相当一部分企业服务业务,转向视频制作与生成。
将这句话与世界模型放在一起,字节的战略轮廓才更完整。
视频生成工具可以帮助客户生产内容。进一步延伸的世界模型,则有机会承接内容运行时的计算:接收行动、维持状态、预测变化,持续输出结果。
这是一种不同于交付视频文件的服务关系。
| 一段成片可以被下载、转存,再放到任意平台播放。一个依赖云端模型持续响应的环境,则需要在交互过程中反复调用模型能力。模型服务商因此有机会进入产品的运行环节,获得持续的业务需求。
具体能留下多少收入,还要看模型效果、推理成本、替代方案与客户议价能力。但争夺的位置已经清楚:谁能成为其他产品运行时所依赖的技术供应商。

对字节,这个位置具有双重意义。
| 一方面,内容平台与创作者生态能够帮助新模型寻找应用。另一方面,倘若字节能把这些应用中积累的技术做成外部客户愿意采购的服务,公司就有机会把优势延伸到自有流量之外。
毕竟游戏开发者、互动内容公司,以及要求更高的仿真与训练客户,并不需要先成为抖音用户,才能使用字节的模型。
当然,从娱乐生成进入工业仿真,绝不会仅仅是把API换一个名字。前文那些关于状态、动作、物理与验证的问题,最终都会变成客户的采购条件。
| 这也是我认为张一鸣此次下注中更值得关注的部分:字节能否把内容领域的优势,转化成其他行业也愿意依赖的基础能力。
假如项目只改善了短剧和直播体验,字节依然可能获得一项不错的生意。但世界模型带来的更大机会,会属于那些能够持续提供可靠环境、帮助智能体积累有效经验的公司。
更微妙的风险在于,字节未必会先失去用户。
即使人们继续在抖音观看和参与,支撑交互世界的核心模型,也可能由别的公司提供。平台依然掌握入口,部分技术主动权与利润空间却可能沿着持续发生的模型调用,流向新的供应商。

因此,这场竞争不能只用用户时长衡量。还要看开发者依赖谁的模型,智能体在哪些环境里学习,以及谁能把生成出来的经验变成可验证的能力。
| 张一鸣督战的分量,最终要落到这里:当字节把越来越多的人带进生成的世界,字节能否同时成为这些世界的技术供应商。
内容平台的领先,可以帮助字节拿到第一批用户。世界模型的领先,才可能让字节拿到那些并不属于抖音的客户。
(声明:本文依据公开报道及资料撰写。有关字节世界模型项目的信息主要来自媒体援引的知情人士,尚未经字节官方确认,具体计划及技术表现以官方披露为准。文中分析仅供行业讨论,不构成投资建议,亦不应作为投资决策依据。)
更新时间:2026-09-09
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号