兆瓦变tokens:英伟达把AI工厂产能多榨24%

八月的硅谷,一个闷热的傍晚,太阳刚落下去,空调负荷猛地窜高。当地电力公司给一座 AI 工厂发了条信号,让它把用电降一降。

四十来号人挤在 Zoom 上盯着屏幕:有做电力调度的 Emerald AI 团队,有数据中心和电网的工程师。没有一个人动手。Emerald AI 的 Conductor 平台收到电网状态信号后,自动把能等的计算任务放慢或改期,高优先级的服务照常跑。目标是在电网吃紧时压低用电,却又不打断关键的 AI 负载。

屏幕上用电曲线真的降下来那一刻,满屋子人欢呼起来。"我们当时屏着呼吸在看,"现场一位负责人说,"这是第一次在几千张英伟达 GPU 上真刀真枪地部署。"

当地电力公司此后又向那座 AI 工厂发了 200 多次降载信号,每一次都成了。

这就是已在生产环境里跑起来的电网柔性调度。它指向的东西,比圣克拉拉那一座机房大得多:一条让 AI 工厂拿到所需电力的路径,而不用等上十年去新建输电线路。宜未雨而绸缪,毋临渴而掘井,与其等电荒了再去架线,不如现在就把用电的弹性做出来。

在 AI 基础设施峰会上,英伟达负责超大规模与高性能计算业务的副总裁,把"AI 工厂能效"摆上了基础设施主题演讲的 C 位。同一天放出的数字给了它硬支撑:同一份固定电力预算,只要管得够聪明,可以多跑出 24% 的 token 吞吐。

"这套概念验证让我们相信,已经越过了固定电力预算的限制,"Lambda 云服务负责人说,"DSX MaxLPS 让原本被白白搁置的容量被重新捞回来、变成实打实的算力,同样的占地塞进更多计算密度。"

那个八月的傍晚,电力公司一个信号过来,Conductor 就照着一套预先定好的任务优先级执行:最低优先级的作业让路,高优先级的推理继续跑,用电从 4 兆瓦落到 3 兆瓦。全自动,不需要人值守。

在 AI 工厂这门生意里,电力就是瓶颈,每吉瓦产出多少有效工作才是指标。数据中心运营者对能效抠得很细——每一瓦都得用在刀刃上,从机房设计到机架级供电转换,整个行业在每一层都榨出了可观的提升。

DSX 把这套纪律延伸到 AI 负载本身:更聪明的机架供电调度,把电力送到负载真正需要的地方;更强的运营智能——更紧的调度、更快的重启、更精简的检查点——让 GPU 一直干活,而不是干等。目标还是运营者一直在追的那件事:用同样的电,做更多的活。

"一座 1 吉瓦的工厂,永远不会变成 2 吉瓦的工厂,"英伟达创始人兼 CEO 黄仁勋说过。

当系统撞上物理极限,工程师最终给出的答案永远只有一句话:别再抠零件,去设计整个系统——得其大者可以兼其小。

今年 5 月在 GTC 台北发布的英伟达 DSX,就是为 AI 工厂给出的那个答案,早期部署已经在验证它。整套平台覆盖网络、冷却、水效和机房设计;下面几节只看它在电力管理和电网参与上已经拿到的结果。

同样的预算,更多算力:DSX MaxLPS

Lambda 在 AI 基础设施峰会上放出的结果,是 DSX MaxLPS 在英伟达 HGX B200 GPU 服务器上的首次验证。

DSX MaxLPS 盯着 GPU 与机架级的用电,按负载类型在节点之间重新分配富余电力,把静态供电方案会白白搁置的容量捞回来。训练和推理吃电的方式不一样;对同时跑这两类负载的 AI 工厂,MaxLPS 会把分配调得更优。

Lambda 是家 GPU 云厂商,客户超过一万家,从 AI 原生创业公司到超大规模厂商都有。它在一套五机架、19 节点的集群上跑了这套软件。

结果:让 19 个节点跑在原本只够 16 个节点满载的电力预算里,集群整体的 token 吞吐多出 24%——从大约每秒 400 万 token 提到 500 万。每瓦性能提升 23%。

按英伟达的测算,在合适的部署环境里,DSX MaxLPS 能在同样的兆瓦预算下,为下一代 Vera Rubin NVL72 AI 工厂多开出最多 40% 的 GPU 容量。

自动需求响应,已在生产验证

圣克拉拉那个故事,还算不上 DSX Flex 的正式部署,它更早、也更关键:它证明了这套思路在商业规模上跑得通。英伟达自家的 Eos AI 工厂正以参与者身份运行 Emerald AI Conductor,接入当地电力公司首个把 AI 工厂当作可调度资源的商业电网项目。

电力公司信号一发,Conductor 一分钟内就响应。愿意柔性调节的工厂,反而能跑得更大。

这正是 DSX Flex 要做成通用能力的那套模式——随着平台成熟,Emerald AI Conductor 会并进 DSX Flex。首个专门的 DSX Flex 商业部署,将落在一座 96 兆瓦的 Vera Rubin AI 工厂上,建立在此前横跨两大洲的五次演示之上。

下一层供电架构:800V 直流

今天 AI 工厂内部拿到的增益,是真实且当下就能部署的。再往下一层,是怎么把电送进越来越密的加速计算机架。

随着 AI 工厂扩张,传统低压供电路径会带来更多转换环节和配电约束。英伟达的 800V 直流架构,就是为了减少转换环节、提升供电效率、支撑更密的加速计算机架。DSX 正在把 800V 直流纳入自己的参考设计。

优化整座工厂,而不是零件

没有任何单一部件能独自优化一座 AI 工厂。GPU 再快,也得等网络;供电方案一糟,电力就被搁置;冷却开销还会从 GPU 那里抢电——GB200 NVL72 机架用直接液冷,要带走约 120 千瓦的热量,这些电在变成算力之前,总得先有个去处。

要让每兆瓦产出更多 token,唯一可靠的路是把整座工厂一起优化:上机架之前先用 DSX Sim 仿真,跑起来之后用 DSX OS 和 DSX Exchange,再加上 DSX 参考设计,让建设者从一个已经验证过的架构起步,而不是从零开始。

吉瓦基础设施的新标尺

说到底就一个问题:这座工厂每消耗一兆瓦,到底产出多少有效工作?

英伟达 DSX 把参考设计、仿真工具、运营软件和电力管理技术交到基础设施建设者手里,让他们能就这个指标比拼,当下硬件能用,下一代也一样。

电网需要松一口气时,工厂松了,却一个作业没掉、一度电没多要。对英伟达 DSX 来说,这就是 AI 工厂该有的新基准。

原文链接:
https://blogs.nvidia.com/blog/from-megawatts-to-tokens-how-nvidia-maximizes-ai-factory-production

展开阅读全文

更新时间:2026-09-30

标签:科技   英伟   工厂   电力   机架   电网   负载   优先级   基础设施   节点   预算

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top