清华等发布Vidu S2:实时720p交互数字人与流式视频编辑双突破

清华&生数科技发布Vidu S2:实时720p交互数字人与流式视频编辑双突破


“千呼万唤始出来,犹抱琵琶半遮面”——这句诗恰如其分地道尽了当下视频生成大模型的现实痛点:用户输入提示词后,往往需要经历数分钟乃至数十分钟的漫长等待,最终只能被动接收一段无法即时干预的成品,与即时通讯、直播互动、游戏娱乐所需要的“即时交互反馈”相距甚远。

为了打破这一困境,清华大学与生数科技联合发布了全新一代实时流式视频生成系统 Vidu S2。该系统在常规硬件上实现了 720p 画质下 25~42 FPS 的极速响应,由两大核心模型协同驱动:

告别“被动等待”,从单向渲染迈入“言出法随”的实时交互时代。

Vidu S2 系统总览

背景与动机:为什么必须转向实时流式生成?

从供需模型的本质出发,离线视频由于具备可多次回放与社交分发的属性,其生成需求规模受限于人均单次观看量;而实时交互性视觉内容(如面对面虚拟陪伴、数字人直播、即时换装)属于消耗性与即时响应的单播体验。论文推导指出,在假定基础需求系数相当的情况下,实时交互视频生成的工业落地需求体量将在规模上远超离线生成。

然而,上一代流式模型 Vidu S1 仍存在数项瓶颈:生成分辨率受限于 540p;人物身份参考图在流式会话开启后完全固化;生成范围集中于微动作的大头照或播报场景,面对大幅度全身动作(如跳舞)极易失控;且完全无法接收外部正在传输的视频流进行在线重绘。

构建一个鲁棒的实时交互视频系统,必须同时解决四大底层难题:

  1. 长时序误差累积与分布偏移:流式生成按分块(Chunk)逐步推进,先前后序分块的误差会迅速级联导致画面崩溃;
  2. 高画质与低延迟的算力矛盾:在消费级 GPU 上实现 720p 实时生成(>25 FPS)留给去噪步骤的计算窗口极小;
  3. 时序因果条件下的动态控制:如何在中途随意更换道具、服装或背景而不导致角色身份漂移;
  4. 视频编辑的严格动作同步:在对外部视频流进行实时重绘时,如何确保新生成帧与源输入帧保持动作节拍严格对齐。

Vidu S2-Avatar:高保真长时程交互数字人

针对数字人生成,Vidu S2-Avatar 在训练范式、分辨率增强、多模态智能体控制等方面构建了系统的解决方案。

1. 数据管线革新:高清晰度与背景稳定算子

数据准备管线总览

如上图(左侧)所示,Vidu S2-Avatar 的数据流水线包含了五大阶段。针对大幅度肢体动作学习,团队特地引入了大量独舞视频与 2D/3D 动画数据。

2. 自重放强制(Self-Replay Forcing, SRF)



此外,系统在训练阶段引入了两阶段偏好对齐:在双向预训练阶段采用 Diffusion DPO 提升动作与面部自然度,在流式因果阶段则基于 SRF 轨迹执行流式负向感知微调(Streaming NFT),使模型在推理阶段的自回归状态下依然能够精准契合人类偏好。

3. 单步潜空间超分与非对称缓存调度

为了在保持 25~42 FPS 高吞吐的同时输出 720p 视频,系统将生成解耦为 Backbone 与单步潜空间精炼器(Super-Resolution Refiner):


4. 软硬协同的低延迟推理引擎

为了在常规消费级 GPU 上落地,系统集成并拓展了 TurboDiffusion 与 TurboServe 的工程栈:

5. 多模态 Agent 闭环控制

多模态 Agent 交互系统架构

为了支持交互中任意时刻的参考图注入与连续复杂指令执行,系统集成了视觉语言模型(VLM)构建的智能体系统。如上图所示,用户输入语音、文本或新增参考图后,VLM 负责拆解生成提示词并保持未修改状态的连续性;同时,VLM 持续按时序审查已生成的视频帧,判定“拿杯子”或“脱帽子”等动作是否完成,并闭环触发下一步动作描述(下图),解决了长对话流中的动作重复或中断痛点。

参考图与配饰控制样例

Vidu S2-Editing:严格帧对齐的流式视频编辑

针对外部视频流实时编辑任务,Vidu S2-Editing 提出了专用的架构设计与合成数据管线。

1. 帧对齐注意力(Frame-Aligned Attention)



2. 成对数据合成与因果防泄漏 Caption

如数据管线图(Figure 2 右侧)所示,针对风格迁移任务,团队采用 NormalCrafter 提取原视频的表面法线序列,训练以表面法线和参考图为条件的视频重建模型,进而将参考图替换为 50 余种特定风格图像(如水墨工笔、赛博朋克、动漫等)生成成对训练数据。同时,编辑提示词生成时不向 VLM 提供源视频内容,仅描述编辑意图与保留约束,彻底切断了源视频信息向文本条件的泄露。

3. 模块间动态时分复用调度(Inter-Module Scheduling)

在实时编辑流水线中,VAE 编码器、Backbone、Refiner 和 VAE 解码器各司其职且呈阶段性活跃。传统静态显存分配会导致部分显卡在等待时闲置。系统采用了统一时间轴上的动态多卡调度,在 Backbone 完成计算的间隙立即将算力交由 VAE 执行编解码,极大降低了整体推理延迟。

实时空间视频生成与编辑

实时空间视频生成与编辑效果展示

为了赋予视频生成真正的 3D 沉浸感,Vidu S2 探索了实时空间双目视频方案:

性能表现与实验验证

1. 数字人基准:StreamAV-Bench 全项登顶

在流式音视频综合基准评测 StreamAV-Bench 上,Vidu S2-Avatar 与当前最前沿的实时及离线数字人模型进行了系统对比:

StreamAV-Bench 评测结果

从上表可以看出,Vidu S2-Avatar 在所有 9 项指标上全面取得 第一名(SOTA)

2. 视频编辑公开评测:领跑离线与流式基准

Sparkle-Bench 评测结果

在 Sparkle-Bench(上表)中,Vidu S2-Editing 取得了 3.74 的最高综合分(Overall),在前/背景指令遵循及运动保持上均显著优于 Decart-Lucy2.5 等流式基线与 Kiwi-Edit 5B 等离线基线。

OpenVE 与 RefVIE 联合评测结果

在 OpenVE 与 RefVIE 联合评测(上表)中,Vidu S2-Editing 的联合总分达到 4.26,反超了 14B 参数量的最强离线大模型 Bernini-R 14B(3.92)。

ViViD 非成对虚拟试衣评测结果

在 ViViD 非成对虚拟试衣测试集(上表)中,反映视频分布与时序连贯性的综合指标 VFID(越低越好)被大幅拉低至 9.9515,相较于专用模型 CatVTON(19.5131)和 ViViD(21.8032)呈现出显著优势。

3. 长时程衰减曲线与商业闭源模型 GSB 人工盲测

不同时长下的生成质量衰减曲线

流式生成最忌“首段惊艳、后段崩溃”。上图展示了从 10 秒延伸至 90 秒时的人工评测均分曲线。Vidu S2-Avatar 在一致性、视频质量、动作质量、表情表现力与综合质量五个维度上保持平稳高位,而基线系统则随着生成时长的增加出现了不同程度的质量下滑。

数字人场景商业系统 GSB 双盲评测结果

在严格的双盲 Good/Same/Bad(GSB)人工偏好评测中:

视频编辑场景商业系统 GSB 双盲评测结果

4. 定性案例分析

数字人定性对比案例

在数字人定性对比(上图)中,基线系统在长时间推移下频繁出现脸部特征漂移、比例失调以及手部或化妆品道具形变扭曲;而 Vidu S2-Avatar 稳定保持了微小的眼部轮廓、发际线细节与持握道具的几何结构。

风格迁移定性对比案例

虚拟试衣定性对比案例

主体替换定性对比案例

背景替换定性对比案例

在视频编辑案例中:

写在最后

Vidu S2 的提出代表着视频生成技术正加速从传统的“被动批量离线渲染”跨入“实时可交互流式处理”的新发展周期。通过在训练端提出突破长程漂移的 Self-Replay Forcing,在模型端设计非对称缓存解耦超分精炼器,并在架构上实现源视频流帧对齐交互与双目立体拓扑,该系统在保证低延迟的同时,在多项公开评测基准和商业系统盲测中展现出明显优势。

对于行业而言,实时流式视频技术不仅是虚拟主播或互动娱乐的效能升级,更展现出了与空间计算、全景漫游以及未来实时渲染元宇宙场景深度融合的广阔潜力。


展开阅读全文

更新时间:2026-09-24

标签:数码   清华   实时   数字   视频   模型   系统   离线   背景   动作   基线   算子

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top