博客 • AI / 算力
AI 为什么越来越贵?NVIDIA GPU、HBM、数据中心与大模型算力战争全面解析
AI 越来越贵,不是因为聊天窗口突然开始收费,而是因为每一次「更好」都要消耗更多 GPU、更多 HBM、更多电和更多机柜。2026 年中,一张 H100 仍卖 2.5–4 万美元;H200、B200 继续往上走;一整柜 GB200 NVL72 的系统报价到了 200–340 万美元。
NVIDIA 自己说,现有客户的需求大约只能满足 70%。2026 年 8 月,公司通知大客户:受内存成本推动,部分 AI 服务器提价超过 15%。贵已经从「买不到卡」变成「卡、内存和电一起涨」。
用户看到的是 token 单价;公司账本上写的是 GPU 小时、HBM 容量和兆瓦电。这两套数字对不上,讨论就会停在口号里。
本文将说明:
- 贵的是整条算力供应链,不是某一个模型
- NVIDIA 从 H100 到 GB300 的价格阶梯
- HBM 为什么成了真正的瓶颈
- 数据中心的电、冷却和选址为什么比芯片更慢
- 训练一次贵、推理天天贵,开发者怎么读账单里的 JSON
先记住这一点:用户付的是 token,公司付的是 GPU 小时、HBM 容量和兆瓦电。下面按「供应链 → GPU → HBM → 机房 → 训练/推理 → 开发者账单」拆开。
贵的不是模型,是整条算力供应链
先把「AI 贵」拆成六层。每一层卖的东西不同,卡点也不同。把它们叠在一起,才是 2026 年的账单。
| 层 | 卖什么 | 2026 年的卡点 |
|---|---|---|
| 模型 | 权重、许可证、评测 | 开权重不免费跑;分发入口正在被芯片厂商买走 |
| GPU | 加速器与整机 | 供给只能覆盖约 70% 需求;单价不跌 |
| HBM | 权重和 KV cache 的住所 | 占 Blackwell 物料成本约一半;HBM4 售罄到 2027 |
| CoWoS | 把逻辑芯片和 HBM 焊在一起 | TSMC CoWoS 交期超过 52 周,产能已被预订到 2026–2027 |
| 数据中心 | 土地、变电站、液冷、机柜 | 一柜 GB200 要 120–130 kW;电比芯片更慢 |
| Token / API | 按次计费的接口 | 单价可以微调,底层 GPU 小时和电价不会一起降 |
所以「AI 为什么越来越贵」不是一个产品问题。模型可以开源,API 可以打折,但 HBM 堆叠、CoWoS 封装和变电站扩容没有同等折扣。
NVIDIA GPU:从一张卡到一柜子
NVIDIA 不公布数据中心 GPU 的官方价目表。街货、OEM 和云报价差好几倍。下面这张表用 2026 年 7 月前后的市场区间,对照 NVIDIA H200 和 GB200 NVL72 的公开规格。数字是区间,不是发票。
看表时先分清两件事:买的是芯片,还是机柜;付的是一次性资本支出,还是按小时租金。
| SKU | 架构 | HBM | 采购价(约) | 云租金中位/区间(每 GPU 小时) |
|---|---|---|---|---|
| H100 SXM5 | Hopper | 80GB HBM3 / 3.35 TB/s | $25,000–$40,000 | ~$2.29 |
| H200 SXM | Hopper | 141GB HBM3e / 4.8 TB/s | $30,000–$40,000 | ~$3.95 |
| B200 SXM6 | Blackwell | 180–192GB HBM3e / 8 TB/s | $40,000–$45,000 | $3.75–$9.86 |
| GB200 NVL72 | Blackwell rack | 13.4TB / 72 GPU | $2M–$3.4M | $10.50–$27.00 |
| GB300 NVL72 | Blackwell Ultra | 288GB HBM3e / GPU | $3.7M–$4M | — |
从 H100 到 B200,单卡标价只上了一个台阶;从单卡到 GB200 NVL72,购买单位变了。你不再买一块加速器,而是买一套要液冷、要 120–130 kW、整柜重约 1.36 吨的系统。下一代 Vera Rubin NVL72 的坊间估价已经到单柜约 880 万美元。
云上的价差同样大。H100 on-demand 市场中位大约每小时 2.29 美元,观测区间 1.38–11.06 美元;H200 中位大约 3.95 美元——多出来的钱,主要买的是 141GB HBM3e,不是更多 FLOPS。B200 仍然紧,租金 3.75–9.86 美元;整柜 GB200 按 GPU 计可以到 10.50–27.00 美元。
NVIDIA 2027 财年第一季度数据中心收入 752 亿美元,同比 +92%。分析师估计它仍占 AI 加速器收入的 75%–90%。价格没有按消费级显卡的逻辑往下走,因为需求还压在供给上面。
HBM:真正卡脖子的是内存
大模型吃的不只是算力。权重要装进显存,推理时 KV cache 还要继续膨胀。上下文越长、专家混合模型越大、推理步数越多,HBM 就越紧。H100 是 80GB HBM3;H200 把同一代架构的可用内存抬到 141GB HBM3e;B200 再到 180–192GB。带宽从 3.35 TB/s 跳到 8 TB/s。
贵也写在物料清单上。业界估算 Blackwell 的制造成本大约是 H100 的两倍,其中 HBM 接近一半。芯片涨价,经常是内存在涨。
| 信号 | 2026 年中的事实 | 口径 |
|---|---|---|
| HBM3e @ Blackwell | 约占 GPU 物料成本 45%–50% | 供应链 / BOM 拆解 |
| HBM4 2026 | 全年产能售罄,客户到手约 60%–70% | Micron / TrendForce |
| AI 服务器涨价 | 对 Vera Rubin / Grace Blackwell 配置通知 >15%,2027 年初出货生效 | NVIDIA / Bloomberg / CNBC |
| 现有客户订单满足率 | ~70% | NVIDIA Q2 FY2027 |
2026 年 8 月下旬,NVIDIA 在财报里用「极端」形容内存成本,并下调毛利率指引。这不是公关修辞。HBM 供应商只有 SK hynix、三星和美光三家能量产先进堆叠;12 高 HBM4E 的良率和认证还不确定,Rubin Ultra 甚至在评估降规格。
内存厂的定价权会一直维持到供给追上需求。开发者能做的不是「等 HBM 降价」,而是少浪费显存:量化、投机解码、更短的默认上下文,以及把 KV cache 当一等公民来记账。官方产品页见 SK hynix HBM。
数据中心:电、冷却和土地比芯片更慢
就算明天 HBM 够用,机房也跟不上。一张 1000W 的 B200 已经不便宜;72 张 GPU 锁进一个 NVLink 域,整柜要 120–130 kW 液冷。门框、楼板荷载、冷却回路和变电站,都不是下单就能加速的东西。
IEA Energy and AI 预计全球数据中心用电将在 2030 年前后翻倍,AI 优化机房的增速更快。Epoch AI 与 EPRI 的估算是:前沿训练功率已超过 100 MW,并可能以每年 2.2–2.9 倍增长,2028 年单次训练到 1–2 GW。电,比晶圆更难搬家。
-
1
功率密度改写机房
旧机柜按 10–20 kW 设计。GB200 一类机柜直接跳到 120 kW 以上,风冷不够,必须上液冷和更粗的配电。
-
2
变电站和输电更慢
芯片交期以季度计,高压接入以年计。很多「已下单的 GPU」会先在仓库或分阶段上电,不是因为不想用,是因为电还没接到。
-
3
选址变成能源问题
超大规模买家在追核电协议、燃气调峰和自建发电。土地便宜但没有多余电力的地方,建不成 AI 工厂。
-
4
推理把峰值摊成基荷
训练是几个月的脉冲;聊天、搜索和 Agent 是全年基荷。IEA 的口径里,AI 服务器用电增量里接近一半来自推理。
所以「再买一万张 GPU」经常不是采购问题,是电网问题。算力战争的前线,有一半画在电业地图上。
大模型算力战争:训练一次,推理每天
Epoch AI 2024 估过:2016 年以来,最吃算力的训练摊销成本大约每年乘 2.4 倍。那时 GPT-4 量级的公开估算还在数千万美元;按同一斜率,前沿训练在 2027 年前后会跨过十亿美元。2026 年的新变量是推理:推理模型和 test-time compute 让「一次回答」变成「很多次前向」。
| 阶段 | 谁在付钱 | 2026 年的变化 |
|---|---|---|
| 预训练 | 少数实验室 + 云/芯片合同 | 单次训练功率已到百兆瓦;多机房训练开始出现 |
| 后训练 / 强化学习 | 同一批实验室,账单更碎 | 推理轨迹本身要占 GPU;「训练」和「推理」的边界变糊 |
| 在线推理 | 所有产品用户 | 占 AI 算力 80%–90%;长上下文和推理链直接吃 HBM |
这就是为什么 API 单价不一定跟着「下一张卡更快」往下掉。卡更快,但每次请求走的步数更多,住在 HBM 里的状态也更大。单位 FLOPS 在便宜,单位有用回答不一定。
开源这边同样要付账。权重可以免费下,集群不能。谁控制默认的发现入口和推理套餐,谁就更接近定价权——这也是 NVIDIA 愿意花 129 亿美元买 Hugging Face 的背景。
对开发者意味着什么
从今天到 2027,该改的是用法,不是情怀。下面四件事比「再等一降价」有用。
-
1
把上下文和推理深度当成本旋钮
默认 128K 上下文和默认「想久一点」会直接转化成 HBM 和 GPU 小时。产品层设上限,比在账单出来后惊讶更便宜。
-
2
区分实验集群和生产集群
评测、扫描和一次性微调走现货或抢占;生产推理走预留。混在同一张 on-demand 账单里,是最贵的用法。
-
3
开权重省的是毛利,不是电
本地部署仍然要买或租 GPU。把 revision 和 license 钉死,参考 NVIDIA 收购 Hugging Face,比假设 Hub 永远免费托管更稳。
-
4
用 JSON 把账单变成可校验的契约
云发票、内部 GPU 库存和 token 用量最终都是 JSON。字段对不上,你就没法回答「贵在哪一层」。
成本账单里的 JSON 长什么样
股权新闻和财报口径帮不了你对账。你真正能操作的,是每月从云厂商或内部平台拉下来的用量对象。
下面是一份可以本地校验的月度账单形状——字段名常见于内部成本系统,数字是示例,不是某家云的真实发票。
{
"period": "2026-08",
"cluster": "inference-prod-1",
"sku": "H200-SXM",
"gpu_count": 64,
"gpu_hours": 18432,
"usd_per_gpu_hour": 3.95,
"power_kwh": 12902,
"usd_per_kwh": 0.08,
"tokens_out": 4120000000,
"currency": "USD"
}
有了这张对象,才能回答三个问题:这个月 GPU 小时乘单价是多少、电费占多少、每个输出 token 均摊多少。缺 sku 或把 gpu_hours 写成字符串,后面的报表都会漂。
{
"$schema": "https://json-schema.org/draft/2020-12/schema",
"type": "object",
"required": [
"period", "sku", "gpu_hours",
"usd_per_gpu_hour", "currency"
],
"properties": {
"period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
"cluster": { "type": "string", "minLength": 1 },
"sku": { "type": "string", "minLength": 1 },
"gpu_count": { "type": "integer", "minimum": 1 },
"gpu_hours": { "type": "number", "minimum": 0 },
"usd_per_gpu_hour": { "type": "number", "minimum": 0 },
"power_kwh": { "type": "number", "minimum": 0 },
"usd_per_kwh": { "type": "number", "minimum": 0 },
"tokens_out": { "type": "integer", "minimum": 0 },
"currency": { "type": "string", "enum": ["USD"] }
},
"additionalProperties": false
}
同一套习惯也适用于模型 API 的 usage 字段:prompt_tokens、completion_tokens、reasoning_tokens。先校验形状,再谈优化。
用 JSONNote 核对账单
慢的部分很少是写公式。慢的是看见两份 JSON 在哪一行对不上。JSONNote 在浏览器本地运行:
-
1
先格式化发票
把云导出或内部 API 的用量对象贴进 JSON 格式化,先排除语法和缩进噪音。
-
2
用 schema 卡住必填字段
把上面的草稿贴到 JSON Schema 页,确认 period、sku、gpu_hours 和单价还在。
-
3
对比两个月
用 JSON Diff 看 sku 有没有从 H100 换成 H200、单价和 gpu_hours 哪一项在涨。
-
4
需要给同事看时再分享
用 Hash 分享 把示例(不要放密钥)放进 URL fragment,数据不经过服务器。
常见问题
AI 变贵只是因为 GPU 涨价吗?
不是。GPU 只是最显眼的一层。HBM、CoWoS 封装、电力、液冷和变电站周期都在涨。NVIDIA 2026 年 8 月把部分 AI 服务器提价超过 15%,主因写明是内存成本。
HBM 是什么,为什么比芯片还紧?
HBM 是堆叠在 GPU 旁边的高带宽内存。大模型的权重和 KV cache 都住在这里。Blackwell 一代里 HBM 大约占物料成本的 45%–50%。SK hynix、三星、美光 2026 年 HBM4 基本售罄,客户只能拿到订单的 60%–70%。
训练贵,还是推理贵?
训练是一次性的天价账单;推理是每天都在发生的账单。业界估计 AI 算力的 80%–90% 已经花在推理上。推理模型的 test-time compute 会把「一次回答」变成「很多次前向」,HBM 和 GPU 小时一起涨。
自己买卡划算,还是租云?
看利用率。集群日利用率长期高于约 60%–70%,买断或长期预留通常更便宜;突发微调、评测和实验更适合按小时租。不要拿一张卡的标价去和 hyperscaler 的 on-demand 比,渠道价差本身就有数倍。
开源模型能躲开这笔账吗?
躲不开。开权重省的是 API 毛利,不是 GPU、HBM 和电。权重免费下载之后,仍然要有人付钱跑它。分发入口甚至可能更贵——参见 NVIDIA 收购 Hugging Face 的交易。
总结
AI 越来越贵,是因为需求压在四样短的东西上:NVIDIA GPU、HBM、先进封装,以及接得上电的机柜。
用户付 token,公司付 GPU 小时和兆瓦。HBM 已经写进服务器涨价通知。
开发者能做的,是把上下文、推理深度和集群类型写成可校验的 JSON,而不是等下一张卡自动降价。在 JSONNote 里格式化、校验、Diff——密钥和账单都不必上传。