
八月的硅谷,一个闷热的傍晚,太阳刚落下去,空调负荷猛地窜高。当地电力公司给一座 AI 工厂发了条信号,让它把用电降一降。
四十来号人挤在 Zoom 上盯着屏幕:有做电力调度的 Emerald AI 团队,有数据中心和电网的工程师。没有一个人动手。Emerald AI 的 Conductor 平台收到电网状态信号后,自动把能等的计算任务放慢或改期,高优先级的服务照常跑。目标是在电网吃紧时压低用电,却又不打断关键的 AI 负载。
屏幕上用电曲线真的降下来那一刻,满屋子人欢呼起来。"我们当时屏着呼吸在看,"现场一位负责人说,"这是第一次在几千张英伟达 GPU 上真刀真枪地部署。"
当地电力公司此后又向那座 AI 工厂发了 200 多次降载信号,每一次都成了。
这就是已在生产环境里跑起来的电网柔性调度。它指向的东西,比圣克拉拉那一座机房大得多:一条让 AI 工厂拿到所需电力的路径,而不用等上十年去新建输电线路。宜未雨而绸缪,毋临渴而掘井,与其等电荒了再去架线,不如现在就把用电的弹性做出来。

在 AI 基础设施峰会上,英伟达负责超大规模与高性能计算业务的副总裁,把"AI 工厂能效"摆上了基础设施主题演讲的 C 位。同一天放出的数字给了它硬支撑:同一份固定电力预算,只要管得够聪明,可以多跑出 24% 的 token 吞吐。
"这套概念验证让我们相信,已经越过了固定电力预算的限制,"Lambda 云服务负责人说,"DSX MaxLPS 让原本被白白搁置的容量被重新捞回来、变成实打实的算力,同样的占地塞进更多计算密度。"
那个八月的傍晚,电力公司一个信号过来,Conductor 就照着一套预先定好的任务优先级执行:最低优先级的作业让路,高优先级的推理继续跑,用电从 4 兆瓦落到 3 兆瓦。全自动,不需要人值守。
在 AI 工厂这门生意里,电力就是瓶颈,每吉瓦产出多少有效工作才是指标。数据中心运营者对能效抠得很细——每一瓦都得用在刀刃上,从机房设计到机架级供电转换,整个行业在每一层都榨出了可观的提升。
DSX 把这套纪律延伸到 AI 负载本身:更聪明的机架供电调度,把电力送到负载真正需要的地方;更强的运营智能——更紧的调度、更快的重启、更精简的检查点——让 GPU 一直干活,而不是干等。目标还是运营者一直在追的那件事:用同样的电,做更多的活。
"一座 1 吉瓦的工厂,永远不会变成 2 吉瓦的工厂,"英伟达创始人兼 CEO 黄仁勋说过。
当系统撞上物理极限,工程师最终给出的答案永远只有一句话:别再抠零件,去设计整个系统——得其大者可以兼其小。
今年 5 月在 GTC 台北发布的英伟达 DSX,就是为 AI 工厂给出的那个答案,早期部署已经在验证它。整套平台覆盖网络、冷却、水效和机房设计;下面几节只看它在电力管理和电网参与上已经拿到的结果。
Lambda 在 AI 基础设施峰会上放出的结果,是 DSX MaxLPS 在英伟达 HGX B200 GPU 服务器上的首次验证。
DSX MaxLPS 盯着 GPU 与机架级的用电,按负载类型在节点之间重新分配富余电力,把静态供电方案会白白搁置的容量捞回来。训练和推理吃电的方式不一样;对同时跑这两类负载的 AI 工厂,MaxLPS 会把分配调得更优。
Lambda 是家 GPU 云厂商,客户超过一万家,从 AI 原生创业公司到超大规模厂商都有。它在一套五机架、19 节点的集群上跑了这套软件。
结果:让 19 个节点跑在原本只够 16 个节点满载的电力预算里,集群整体的 token 吞吐多出 24%——从大约每秒 400 万 token 提到 500 万。每瓦性能提升 23%。
按英伟达的测算,在合适的部署环境里,DSX MaxLPS 能在同样的兆瓦预算下,为下一代 Vera Rubin NVL72 AI 工厂多开出最多 40% 的 GPU 容量。
圣克拉拉那个故事,还算不上 DSX Flex 的正式部署,它更早、也更关键:它证明了这套思路在商业规模上跑得通。英伟达自家的 Eos AI 工厂正以参与者身份运行 Emerald AI Conductor,接入当地电力公司首个把 AI 工厂当作可调度资源的商业电网项目。
电力公司信号一发,Conductor 一分钟内就响应。愿意柔性调节的工厂,反而能跑得更大。
这正是 DSX Flex 要做成通用能力的那套模式——随着平台成熟,Emerald AI Conductor 会并进 DSX Flex。首个专门的 DSX Flex 商业部署,将落在一座 96 兆瓦的 Vera Rubin AI 工厂上,建立在此前横跨两大洲的五次演示之上。
今天 AI 工厂内部拿到的增益,是真实且当下就能部署的。再往下一层,是怎么把电送进越来越密的加速计算机架。
随着 AI 工厂扩张,传统低压供电路径会带来更多转换环节和配电约束。英伟达的 800V 直流架构,就是为了减少转换环节、提升供电效率、支撑更密的加速计算机架。DSX 正在把 800V 直流纳入自己的参考设计。
没有任何单一部件能独自优化一座 AI 工厂。GPU 再快,也得等网络;供电方案一糟,电力就被搁置;冷却开销还会从 GPU 那里抢电——GB200 NVL72 机架用直接液冷,要带走约 120 千瓦的热量,这些电在变成算力之前,总得先有个去处。
要让每兆瓦产出更多 token,唯一可靠的路是把整座工厂一起优化:上机架之前先用 DSX Sim 仿真,跑起来之后用 DSX OS 和 DSX Exchange,再加上 DSX 参考设计,让建设者从一个已经验证过的架构起步,而不是从零开始。
说到底就一个问题:这座工厂每消耗一兆瓦,到底产出多少有效工作?
英伟达 DSX 把参考设计、仿真工具、运营软件和电力管理技术交到基础设施建设者手里,让他们能就这个指标比拼,当下硬件能用,下一代也一样。
电网需要松一口气时,工厂松了,却一个作业没掉、一度电没多要。对英伟达 DSX 来说,这就是 AI 工厂该有的新基准。
原文链接:
https://blogs.nvidia.com/blog/from-megawatts-to-tokens-how-nvidia-maximizes-ai-factory-production
更新时间:2026-09-30
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号