博客 AI / 算力

AI 为什么越来越贵?NVIDIA GPU、HBM、数据中心与大模型算力战争全面解析

AI 越来越贵,不是因为聊天窗口突然开始收费,而是因为每一次「更好」都要消耗更多 GPU、更多 HBM、更多电和更多机柜。2026 年中,一张 H100 仍卖 2.5–4 万美元;H200、B200 继续往上走;一整柜 GB200 NVL72 的系统报价到了 200–340 万美元。

NVIDIA 自己说,现有客户的需求大约只能满足 70%。2026 年 8 月,公司通知大客户:受内存成本推动,部分 AI 服务器提价超过 15%。贵已经从「买不到卡」变成「卡、内存和电一起涨」。

用户看到的是 token 单价;公司账本上写的是 GPU 小时、HBM 容量和兆瓦电。这两套数字对不上,讨论就会停在口号里。

本文将说明:

先记住这一点:用户付的是 token,公司付的是 GPU 小时、HBM 容量和兆瓦电。下面按「供应链 → GPU → HBM → 机房 → 训练/推理 → 开发者账单」拆开。

贵的不是模型,是整条算力供应链

先把「AI 贵」拆成六层。每一层卖的东西不同,卡点也不同。把它们叠在一起,才是 2026 年的账单。

卖什么 2026 年的卡点
模型 权重、许可证、评测 开权重不免费跑;分发入口正在被芯片厂商买走
GPU 加速器与整机 供给只能覆盖约 70% 需求;单价不跌
HBM 权重和 KV cache 的住所 占 Blackwell 物料成本约一半;HBM4 售罄到 2027
CoWoS 把逻辑芯片和 HBM 焊在一起 TSMC CoWoS 交期超过 52 周,产能已被预订到 2026–2027
数据中心 土地、变电站、液冷、机柜 一柜 GB200 要 120–130 kW;电比芯片更慢
Token / API 按次计费的接口 单价可以微调,底层 GPU 小时和电价不会一起降

所以「AI 为什么越来越贵」不是一个产品问题。模型可以开源,API 可以打折,但 HBM 堆叠、CoWoS 封装和变电站扩容没有同等折扣。

NVIDIA GPU:从一张卡到一柜子

NVIDIA 不公布数据中心 GPU 的官方价目表。街货、OEM 和云报价差好几倍。下面这张表用 2026 年 7 月前后的市场区间,对照 NVIDIA H200GB200 NVL72 的公开规格。数字是区间,不是发票。

看表时先分清两件事:买的是芯片,还是机柜;付的是一次性资本支出,还是按小时租金。

SKU 架构 HBM 采购价(约) 云租金中位/区间(每 GPU 小时)
H100 SXM5 Hopper 80GB HBM3 / 3.35 TB/s $25,000–$40,000 ~$2.29
H200 SXM Hopper 141GB HBM3e / 4.8 TB/s $30,000–$40,000 ~$3.95
B200 SXM6 Blackwell 180–192GB HBM3e / 8 TB/s $40,000–$45,000 $3.75–$9.86
GB200 NVL72 Blackwell rack 13.4TB / 72 GPU $2M–$3.4M $10.50–$27.00
GB300 NVL72 Blackwell Ultra 288GB HBM3e / GPU $3.7M–$4M

从 H100 到 B200,单卡标价只上了一个台阶;从单卡到 GB200 NVL72,购买单位变了。你不再买一块加速器,而是买一套要液冷、要 120–130 kW、整柜重约 1.36 吨的系统。下一代 Vera Rubin NVL72 的坊间估价已经到单柜约 880 万美元。

云上的价差同样大。H100 on-demand 市场中位大约每小时 2.29 美元,观测区间 1.38–11.06 美元;H200 中位大约 3.95 美元——多出来的钱,主要买的是 141GB HBM3e,不是更多 FLOPS。B200 仍然紧,租金 3.75–9.86 美元;整柜 GB200 按 GPU 计可以到 10.50–27.00 美元。

NVIDIA 2027 财年第一季度数据中心收入 752 亿美元,同比 +92%。分析师估计它仍占 AI 加速器收入的 75%–90%。价格没有按消费级显卡的逻辑往下走,因为需求还压在供给上面。

HBM:真正卡脖子的是内存

大模型吃的不只是算力。权重要装进显存,推理时 KV cache 还要继续膨胀。上下文越长、专家混合模型越大、推理步数越多,HBM 就越紧。H100 是 80GB HBM3;H200 把同一代架构的可用内存抬到 141GB HBM3e;B200 再到 180–192GB。带宽从 3.35 TB/s 跳到 8 TB/s。

贵也写在物料清单上。业界估算 Blackwell 的制造成本大约是 H100 的两倍,其中 HBM 接近一半。芯片涨价,经常是内存在涨。

信号 2026 年中的事实 口径
HBM3e @ Blackwell 约占 GPU 物料成本 45%–50% 供应链 / BOM 拆解
HBM4 2026 全年产能售罄,客户到手约 60%–70% Micron / TrendForce
AI 服务器涨价 对 Vera Rubin / Grace Blackwell 配置通知 >15%,2027 年初出货生效 NVIDIA / Bloomberg / CNBC
现有客户订单满足率 ~70% NVIDIA Q2 FY2027

2026 年 8 月下旬,NVIDIA 在财报里用「极端」形容内存成本,并下调毛利率指引。这不是公关修辞。HBM 供应商只有 SK hynix、三星和美光三家能量产先进堆叠;12 高 HBM4E 的良率和认证还不确定,Rubin Ultra 甚至在评估降规格。

内存厂的定价权会一直维持到供给追上需求。开发者能做的不是「等 HBM 降价」,而是少浪费显存:量化、投机解码、更短的默认上下文,以及把 KV cache 当一等公民来记账。官方产品页见 SK hynix HBM

数据中心:电、冷却和土地比芯片更慢

就算明天 HBM 够用,机房也跟不上。一张 1000W 的 B200 已经不便宜;72 张 GPU 锁进一个 NVLink 域,整柜要 120–130 kW 液冷。门框、楼板荷载、冷却回路和变电站,都不是下单就能加速的东西。

IEA Energy and AI 预计全球数据中心用电将在 2030 年前后翻倍,AI 优化机房的增速更快。Epoch AI 与 EPRI 的估算是:前沿训练功率已超过 100 MW,并可能以每年 2.2–2.9 倍增长,2028 年单次训练到 1–2 GW。电,比晶圆更难搬家。

  1. 1
    功率密度改写机房

    旧机柜按 10–20 kW 设计。GB200 一类机柜直接跳到 120 kW 以上,风冷不够,必须上液冷和更粗的配电。

  2. 2
    变电站和输电更慢

    芯片交期以季度计,高压接入以年计。很多「已下单的 GPU」会先在仓库或分阶段上电,不是因为不想用,是因为电还没接到。

  3. 3
    选址变成能源问题

    超大规模买家在追核电协议、燃气调峰和自建发电。土地便宜但没有多余电力的地方,建不成 AI 工厂。

  4. 4
    推理把峰值摊成基荷

    训练是几个月的脉冲;聊天、搜索和 Agent 是全年基荷。IEA 的口径里,AI 服务器用电增量里接近一半来自推理。

所以「再买一万张 GPU」经常不是采购问题,是电网问题。算力战争的前线,有一半画在电业地图上。

大模型算力战争:训练一次,推理每天

Epoch AI 2024 估过:2016 年以来,最吃算力的训练摊销成本大约每年乘 2.4 倍。那时 GPT-4 量级的公开估算还在数千万美元;按同一斜率,前沿训练在 2027 年前后会跨过十亿美元。2026 年的新变量是推理:推理模型和 test-time compute 让「一次回答」变成「很多次前向」。

阶段 谁在付钱 2026 年的变化
预训练 少数实验室 + 云/芯片合同 单次训练功率已到百兆瓦;多机房训练开始出现
后训练 / 强化学习 同一批实验室,账单更碎 推理轨迹本身要占 GPU;「训练」和「推理」的边界变糊
在线推理 所有产品用户 占 AI 算力 80%–90%;长上下文和推理链直接吃 HBM

这就是为什么 API 单价不一定跟着「下一张卡更快」往下掉。卡更快,但每次请求走的步数更多,住在 HBM 里的状态也更大。单位 FLOPS 在便宜,单位有用回答不一定。

开源这边同样要付账。权重可以免费下,集群不能。谁控制默认的发现入口和推理套餐,谁就更接近定价权——这也是 NVIDIA 愿意花 129 亿美元买 Hugging Face 的背景。

对开发者意味着什么

从今天到 2027,该改的是用法,不是情怀。下面四件事比「再等一降价」有用。

  1. 1
    把上下文和推理深度当成本旋钮

    默认 128K 上下文和默认「想久一点」会直接转化成 HBM 和 GPU 小时。产品层设上限,比在账单出来后惊讶更便宜。

  2. 2
    区分实验集群和生产集群

    评测、扫描和一次性微调走现货或抢占;生产推理走预留。混在同一张 on-demand 账单里,是最贵的用法。

  3. 3
    开权重省的是毛利,不是电

    本地部署仍然要买或租 GPU。把 revision 和 license 钉死,参考 NVIDIA 收购 Hugging Face,比假设 Hub 永远免费托管更稳。

  4. 4
    用 JSON 把账单变成可校验的契约

    云发票、内部 GPU 库存和 token 用量最终都是 JSON。字段对不上,你就没法回答「贵在哪一层」。

成本账单里的 JSON 长什么样

股权新闻和财报口径帮不了你对账。你真正能操作的,是每月从云厂商或内部平台拉下来的用量对象。

下面是一份可以本地校验的月度账单形状——字段名常见于内部成本系统,数字是示例,不是某家云的真实发票。

月度 GPU 推理账单(示例,不是真实发票)
{
  "period": "2026-08",
  "cluster": "inference-prod-1",
  "sku": "H200-SXM",
  "gpu_count": 64,
  "gpu_hours": 18432,
  "usd_per_gpu_hour": 3.95,
  "power_kwh": 12902,
  "usd_per_kwh": 0.08,
  "tokens_out": 4120000000,
  "currency": "USD"
}

有了这张对象,才能回答三个问题:这个月 GPU 小时乘单价是多少、电费占多少、每个输出 token 均摊多少。缺 sku 或把 gpu_hours 写成字符串,后面的报表都会漂。

校验成本对象的 JSON Schema 草稿
{
  "$schema": "https://json-schema.org/draft/2020-12/schema",
  "type": "object",
  "required": [
    "period", "sku", "gpu_hours",
    "usd_per_gpu_hour", "currency"
  ],
  "properties": {
    "period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
    "cluster": { "type": "string", "minLength": 1 },
    "sku": { "type": "string", "minLength": 1 },
    "gpu_count": { "type": "integer", "minimum": 1 },
    "gpu_hours": { "type": "number", "minimum": 0 },
    "usd_per_gpu_hour": { "type": "number", "minimum": 0 },
    "power_kwh": { "type": "number", "minimum": 0 },
    "usd_per_kwh": { "type": "number", "minimum": 0 },
    "tokens_out": { "type": "integer", "minimum": 0 },
    "currency": { "type": "string", "enum": ["USD"] }
  },
  "additionalProperties": false
}

同一套习惯也适用于模型 API 的 usage 字段:prompt_tokens、completion_tokens、reasoning_tokens。先校验形状,再谈优化。

用 JSONNote 核对账单

慢的部分很少是写公式。慢的是看见两份 JSON 在哪一行对不上。JSONNote 在浏览器本地运行:

  1. 1
    先格式化发票

    把云导出或内部 API 的用量对象贴进 JSON 格式化,先排除语法和缩进噪音。

  2. 2
    用 schema 卡住必填字段

    把上面的草稿贴到 JSON Schema 页,确认 period、sku、gpu_hours 和单价还在。

  3. 3
    对比两个月

    JSON Diff 看 sku 有没有从 H100 换成 H200、单价和 gpu_hours 哪一项在涨。

  4. 4
    需要给同事看时再分享

    Hash 分享 把示例(不要放密钥)放进 URL fragment,数据不经过服务器。

常见问题

AI 变贵只是因为 GPU 涨价吗?

不是。GPU 只是最显眼的一层。HBM、CoWoS 封装、电力、液冷和变电站周期都在涨。NVIDIA 2026 年 8 月把部分 AI 服务器提价超过 15%,主因写明是内存成本。

HBM 是什么,为什么比芯片还紧?

HBM 是堆叠在 GPU 旁边的高带宽内存。大模型的权重和 KV cache 都住在这里。Blackwell 一代里 HBM 大约占物料成本的 45%–50%。SK hynix、三星、美光 2026 年 HBM4 基本售罄,客户只能拿到订单的 60%–70%。

训练贵,还是推理贵?

训练是一次性的天价账单;推理是每天都在发生的账单。业界估计 AI 算力的 80%–90% 已经花在推理上。推理模型的 test-time compute 会把「一次回答」变成「很多次前向」,HBM 和 GPU 小时一起涨。

自己买卡划算,还是租云?

看利用率。集群日利用率长期高于约 60%–70%,买断或长期预留通常更便宜;突发微调、评测和实验更适合按小时租。不要拿一张卡的标价去和 hyperscaler 的 on-demand 比,渠道价差本身就有数倍。

开源模型能躲开这笔账吗?

躲不开。开权重省的是 API 毛利,不是 GPU、HBM 和电。权重免费下载之后,仍然要有人付钱跑它。分发入口甚至可能更贵——参见 NVIDIA 收购 Hugging Face 的交易。

总结

AI 越来越贵,是因为需求压在四样短的东西上:NVIDIA GPU、HBM、先进封装,以及接得上电的机柜。

用户付 token,公司付 GPU 小时和兆瓦。HBM 已经写进服务器涨价通知。

开发者能做的,是把上下文、推理深度和集群类型写成可校验的 JSON,而不是等下一张卡自动降价。在 JSONNote 里格式化、校验、Diff——密钥和账单都不必上传。

← 返回博客