部署 DeepSeek V4 到底要花多少钱?

21:00,第四杯咖啡已经凉了。

DeepSeek V4 发布,下午串霸饶有兴致地在群里问了一句:"咱们要不要上 DeepSeek V4?大概得花多少钱?"

群里安静了十分钟。没人接话。

这事真没有标准报价单。你问云厂商,他报小时价;问二手贩子,他报卡价;问官方,他说你调 API 不就完了。

行,我算。今天不聊架构、不聊评测,就聊钱——部署 V4,租的、买的、国产的、海外的,各是多少。

先搞清楚要几张卡

算钱之前先算卡。

V4 的参数表第一次看会骗人。Pro 激活参数才 49B,有人就以为一张 80G 的卡够了。MoE 推理时所有专家权重都得常驻显存,激活参数只影响速度,不影响显存。你的显存账单,按总参数算。

V4-Flash:284B 总参,权重约 155-160GB。V4-Pro:1.6T 总参,权重约 862-870GB。上下文按 8K 算的,上百万上下文,KV cache 还得再吃掉几十个 G,预算按 1.2 到 1.5 倍打。

模型

权重体积(FP4+FP8)

最小部署配置

V4-Flash


284B 总参 / 13B 激活

约 155-160 GB

1×H200(141G,紧) 或 2×H100/A100 80G

V4-Pro


1.6T 总参 / 49B 激活

约 862-870 GB

8×H200(141G)

或 16×H100 80G

Flash 是工作站级门槛,Pro 是机房级门槛,中间差大概 8 倍的显存钱。

租:贵,还抢不到

2026 年的算力租赁市场就一个词:卖方市场。H100 一年期租约从去年秋天的 1.7 美元/小时涨到今年 3 月的 2.35 美元,涨幅接近四成。国内高端卡"上架即秒光"。

国际平台(2026 年 5 月实时价):

平台

型号

时租(/卡)

RunPod

H100 SXM

$2.39

RunPod

H200 SXM

$3.79

Vast.ai

H100 / H200

$3.75-4.34

AWS p5

8×H100 整机

$55-60/小时

国内(2026 年 5 月行情):

型号

月租/卡

现货状态

H100

5.5-6.0 万

现货售罄,排单 Q1 2027

H200

6.0-6.6 万

上架秒光

A800

约 2.6 万

存量资源,散户难求

H20

2.6-3.3 万

相对好租,推理优选

RTX 4090

时租 1.3-2.0 元

只能跑 Flash 量化原型

具体账:

同一个模型,国内外租价差一倍。国内贵在供需失衡,不是贵在技术。有海外通道的,跑 Flash 阶段去 RunPod 蹲低价卡。

买:更魔幻

B200 国内基本没现货,合规渠道的版本涨幅超 40%,交付排期排到 2027 年上半年——你现在下单,先把行军床上的灰擦了。

方案

参考价

说明

昇腾 910B × 8 整机

150-200 万

国产化首选,比英伟达省 30-40%

H800 × 8 整机

25-30 万美元
≈ 180-216 万人民币

禁运前报价,现在只会更高

H100 单卡

23-27 万起

有价无市,二手市场比新卡现实

昇腾 950

价格未公布

下半年批量上市,V4-Pro 降价就等它

同样一笔钱,买英伟达只能买 8 卡,买昇腾能买 8 卡加一年电费。有国产化要求的,昇腾 910B 是唯一选择——V4 对昇腾是 Day 0 适配,不是"以后再说"。

软件栈别指望白嫖。MindSpore + CANN 的坑,够你踩三个月。前提是你团队里有人踩过。

三笔账摆一起

路线

成本

适合谁

官方 API


Flash 输入 1 元 / 输出 2 元(每百万 token)

按量付费,无固定成本

中小团队首选

,数据可出内网

云租 2×H100 跑 Flash

海外 2.5-4 万/月
国内 11-12 万/月

数据合规要求,量又不大的团队

采购昇腾 8 卡自建 Flash

一次性 150-200 万

长期推理量 + 国产化要求

自建跑 Pro

一次性 300 万+
或云租 30-50 万/月

头部实验室/大厂,普通人别看

自建的账(3 年摊销,不含机房):

自建比 API 便宜,前提是先把 150 万砸进去,再养一个能运维昇腾集群的人。这人的年薪按市场价 60 万,我给你算进去了吗?没有。你自己算。

给三类人各一句实话

中小团队、创业公司:调 API。Flash 的定价已经便宜到没有自建的理由,你们的问题不是模型能不能搬进自家机房,是业务跑不跑得起来。数据敏感就找私有化部署服务商,别自己买卡。

金融、医疗、政务这些合规行业:租不如买。昇腾 910B 8 卡整机 150-200 万,跑 Flash 绰绰有余。两个前提:团队里有人踩过 CANN 的坑;别急着现在出手——昇腾 950 下半年上市,Pro 的部署成本还要再降一截。

大厂、实验室:你们早就在跑 Pro 了。记得提醒下属,8×H200 的账不是买不买得起,是买不买得到——国内交付排期 2027 年 Q2。

算力市场现在是最后一班飞机起飞前订票:价格奇高,座位几乎没有。别迷信买卡自由,先把 API 调明白,业务跑通,等昇腾 950 和 B200 产能起来,再谈自建。你要的是模型能力,不是机房照片。

——夜游者,21:47,第四杯咖啡见底

资料截点:2026 年 7 月 31 日。行情数据来源:AutoDL / RunPod / Vast.ai 平台实时报价、2026 年上半年国内算力租赁市场监测、DeepSeek V4 部署实战公开资料。价格随供需波动,实际以询价为准。

本文为部署成本测算,不构成采购建议。



词元武工队,一群老登+一个实习生搞AI的草台组织。

几个虚构的化名角色,若干真实的工程师故事。

素材源自生活,内容AI辅助生成。如有雷同,或非巧合。

展开阅读全文

更新时间:2026-08-04

标签:科技   国内   总参   权重   显存   团队   整机   机房   模型   成本   英伟

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top