
“千呼万唤始出来,犹抱琵琶半遮面”——这句诗恰如其分地道尽了当下视频生成大模型的现实痛点:用户输入提示词后,往往需要经历数分钟乃至数十分钟的漫长等待,最终只能被动接收一段无法即时干预的成品,与即时通讯、直播互动、游戏娱乐所需要的“即时交互反馈”相距甚远。
为了打破这一困境,清华大学与生数科技联合发布了全新一代实时流式视频生成系统 Vidu S2。该系统在常规硬件上实现了 720p 画质下 25~42 FPS 的极速响应,由两大核心模型协同驱动:
告别“被动等待”,从单向渲染迈入“言出法随”的实时交互时代。

Vidu S2 系统总览
从供需模型的本质出发,离线视频由于具备可多次回放与社交分发的属性,其生成需求规模受限于人均单次观看量;而实时交互性视觉内容(如面对面虚拟陪伴、数字人直播、即时换装)属于消耗性与即时响应的单播体验。论文推导指出,在假定基础需求系数相当的情况下,实时交互视频生成的工业落地需求体量将在规模上远超离线生成。
然而,上一代流式模型 Vidu S1 仍存在数项瓶颈:生成分辨率受限于 540p;人物身份参考图在流式会话开启后完全固化;生成范围集中于微动作的大头照或播报场景,面对大幅度全身动作(如跳舞)极易失控;且完全无法接收外部正在传输的视频流进行在线重绘。
构建一个鲁棒的实时交互视频系统,必须同时解决四大底层难题:
针对数字人生成,Vidu S2-Avatar 在训练范式、分辨率增强、多模态智能体控制等方面构建了系统的解决方案。

数据准备管线总览
如上图(左侧)所示,Vidu S2-Avatar 的数据流水线包含了五大阶段。针对大幅度肢体动作学习,团队特地引入了大量独舞视频与 2D/3D 动画数据。

此外,系统在训练阶段引入了两阶段偏好对齐:在双向预训练阶段采用 Diffusion DPO 提升动作与面部自然度,在流式因果阶段则基于 SRF 轨迹执行流式负向感知微调(Streaming NFT),使模型在推理阶段的自回归状态下依然能够精准契合人类偏好。
为了在保持 25~42 FPS 高吞吐的同时输出 720p 视频,系统将生成解耦为 Backbone 与单步潜空间精炼器(Super-Resolution Refiner):

为了在常规消费级 GPU 上落地,系统集成并拓展了 TurboDiffusion 与 TurboServe 的工程栈:

多模态 Agent 交互系统架构
为了支持交互中任意时刻的参考图注入与连续复杂指令执行,系统集成了视觉语言模型(VLM)构建的智能体系统。如上图所示,用户输入语音、文本或新增参考图后,VLM 负责拆解生成提示词并保持未修改状态的连续性;同时,VLM 持续按时序审查已生成的视频帧,判定“拿杯子”或“脱帽子”等动作是否完成,并闭环触发下一步动作描述(下图),解决了长对话流中的动作重复或中断痛点。

参考图与配饰控制样例
针对外部视频流实时编辑任务,Vidu S2-Editing 提出了专用的架构设计与合成数据管线。

如数据管线图(Figure 2 右侧)所示,针对风格迁移任务,团队采用 NormalCrafter 提取原视频的表面法线序列,训练以表面法线和参考图为条件的视频重建模型,进而将参考图替换为 50 余种特定风格图像(如水墨工笔、赛博朋克、动漫等)生成成对训练数据。同时,编辑提示词生成时不向 VLM 提供源视频内容,仅描述编辑意图与保留约束,彻底切断了源视频信息向文本条件的泄露。
在实时编辑流水线中,VAE 编码器、Backbone、Refiner 和 VAE 解码器各司其职且呈阶段性活跃。传统静态显存分配会导致部分显卡在等待时闲置。系统采用了统一时间轴上的动态多卡调度,在 Backbone 完成计算的间隙立即将算力交由 VAE 执行编解码,极大降低了整体推理延迟。

实时空间视频生成与编辑效果展示
为了赋予视频生成真正的 3D 沉浸感,Vidu S2 探索了实时空间双目视频方案:
在流式音视频综合基准评测 StreamAV-Bench 上,Vidu S2-Avatar 与当前最前沿的实时及离线数字人模型进行了系统对比:

StreamAV-Bench 评测结果
从上表可以看出,Vidu S2-Avatar 在所有 9 项指标上全面取得 第一名(SOTA):

Sparkle-Bench 评测结果
在 Sparkle-Bench(上表)中,Vidu S2-Editing 取得了 3.74 的最高综合分(Overall),在前/背景指令遵循及运动保持上均显著优于 Decart-Lucy2.5 等流式基线与 Kiwi-Edit 5B 等离线基线。

OpenVE 与 RefVIE 联合评测结果
在 OpenVE 与 RefVIE 联合评测(上表)中,Vidu S2-Editing 的联合总分达到 4.26,反超了 14B 参数量的最强离线大模型 Bernini-R 14B(3.92)。

ViViD 非成对虚拟试衣评测结果
在 ViViD 非成对虚拟试衣测试集(上表)中,反映视频分布与时序连贯性的综合指标 VFID(越低越好)被大幅拉低至 9.9515,相较于专用模型 CatVTON(19.5131)和 ViViD(21.8032)呈现出显著优势。

不同时长下的生成质量衰减曲线
流式生成最忌“首段惊艳、后段崩溃”。上图展示了从 10 秒延伸至 90 秒时的人工评测均分曲线。Vidu S2-Avatar 在一致性、视频质量、动作质量、表情表现力与综合质量五个维度上保持平稳高位,而基线系统则随着生成时长的增加出现了不同程度的质量下滑。

数字人场景商业系统 GSB 双盲评测结果
在严格的双盲 Good/Same/Bad(GSB)人工偏好评测中:

视频编辑场景商业系统 GSB 双盲评测结果

数字人定性对比案例
在数字人定性对比(上图)中,基线系统在长时间推移下频繁出现脸部特征漂移、比例失调以及手部或化妆品道具形变扭曲;而 Vidu S2-Avatar 稳定保持了微小的眼部轮廓、发际线细节与持握道具的几何结构。

风格迁移定性对比案例

虚拟试衣定性对比案例

主体替换定性对比案例

背景替换定性对比案例
在视频编辑案例中:
Vidu S2 的提出代表着视频生成技术正加速从传统的“被动批量离线渲染”跨入“实时可交互流式处理”的新发展周期。通过在训练端提出突破长程漂移的 Self-Replay Forcing,在模型端设计非对称缓存解耦超分精炼器,并在架构上实现源视频流帧对齐交互与双目立体拓扑,该系统在保证低延迟的同时,在多项公开评测基准和商业系统盲测中展现出明显优势。
对于行业而言,实时流式视频技术不仅是虚拟主播或互动娱乐的效能升级,更展现出了与空间计算、全景漫游以及未来实时渲染元宇宙场景深度融合的广阔潜力。

更新时间:2026-09-24
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号