博客 AI / 算力

AI 爲什麼越來越貴?NVIDIA GPU、HBM、數據中心與大模型算力戰爭全面解析

AI 越來越貴,不是因爲聊天窗口突然開始收費,而是因爲每一次「更好」都要消耗更多 GPU、更多 HBM、更多電和更多機櫃。2026 年中,一張 H100 仍賣 2.5–4 萬美元;H200、B200 繼續往上走;一整櫃 GB200 NVL72 的系統報價到了 200–340 萬美元。

NVIDIA 自己說,現有客戶的需求大約只能滿足 70%。2026 年 8 月,公司通知大客戶:受內存成本推動,部分 AI 服務器提價超過 15%。貴已經從「買不到卡」變成「卡、內存和電一起漲」。

用戶看到的是 token 單價;公司賬本上寫的是 GPU 小時、HBM 容量和兆瓦電。這兩套數字對不上,討論就會停在口號裏。

本文將說明:

先記住這一點:用戶付的是 token,公司付的是 GPU 小時、HBM 容量和兆瓦電。下面按「供應鏈 → GPU → HBM → 機房 → 訓練/推理 → 開發者賬單」拆開。

貴的不是模型,是整條算力供應鏈

先把「AI 貴」拆成六層。每一層賣的東西不同,卡點也不同。把它們疊在一起,纔是 2026 年的賬單。

賣什麼 2026 年的卡點
模型 權重、許可證、評測 開權重不免費跑;分發入口正在被芯片廠商買走
GPU 加速器與整機 供給只能覆蓋約 70% 需求;單價不跌
HBM 權重和 KV cache 的住所 佔 Blackwell 物料成本約一半;HBM4 售罄到 2027
CoWoS 把邏輯芯片和 HBM 焊在一起 TSMC CoWoS 交期超過 52 周,產能已被預訂到 2026–2027
數據中心 土地、變電站、液冷、機櫃 一櫃 GB200 要 120–130 kW;電比芯片更慢
Token / API 按次計費的接口 單價可以微調,底層 GPU 小時和電價不會一起降

所以「AI 爲什麼越來越貴」不是一個產品問題。模型可以開源,API 可以打折,但 HBM 堆疊、CoWoS 封裝和變電站擴容沒有同等折扣。

NVIDIA GPU:從一張卡到一櫃子

NVIDIA 不公佈數據中心 GPU 的官方價目表。街貨、OEM 和雲報價差好幾倍。下面這張表用 2026 年 7 月前後的市場區間,對照 NVIDIA H200GB200 NVL72 的公開規格。數字是區間,不是發票。

看錶時先分清兩件事:買的是芯片,還是機櫃;付的是一次性資本支出,還是按小時租金。

SKU 架構 HBM 採購價(約) 雲租金中位/區間(每 GPU 小時)
H100 SXM5 Hopper 80GB HBM3 / 3.35 TB/s $25,000–$40,000 ~$2.29
H200 SXM Hopper 141GB HBM3e / 4.8 TB/s $30,000–$40,000 ~$3.95
B200 SXM6 Blackwell 180–192GB HBM3e / 8 TB/s $40,000–$45,000 $3.75–$9.86
GB200 NVL72 Blackwell rack 13.4TB / 72 GPU $2M–$3.4M $10.50–$27.00
GB300 NVL72 Blackwell Ultra 288GB HBM3e / GPU $3.7M–$4M

從 H100 到 B200,單卡標價只上了一個臺階;從單卡到 GB200 NVL72,購買單位變了。你不再買一塊加速器,而是買一套要液冷、要 120–130 kW、整櫃重約 1.36 噸的系統。下一代 Vera Rubin NVL72 的坊間估價已經到單櫃約 880 萬美元。

雲上的價差同樣大。H100 on-demand 市場中位大約每小時 2.29 美元,觀測區間 1.38–11.06 美元;H200 中位大約 3.95 美元——多出來的錢,主要買的是 141GB HBM3e,不是更多 FLOPS。B200 仍然緊,租金 3.75–9.86 美元;整櫃 GB200 按 GPU 計可以到 10.50–27.00 美元。

NVIDIA 2027 財年第一季度數據中心收入 752 億美元,同比 +92%。分析師估計它仍佔 AI 加速器收入的 75%–90%。價格沒有按消費級顯卡的邏輯往下走,因爲需求還壓在供給上面。

HBM:真正卡脖子的是內存

大模型喫的不只是算力。權重要裝進顯存,推理時 KV cache 還要繼續膨脹。上下文越長、專家混合模型越大、推理步數越多,HBM 就越緊。H100 是 80GB HBM3;H200 把同一代架構的可用內存抬到 141GB HBM3e;B200 再到 180–192GB。帶寬從 3.35 TB/s 跳到 8 TB/s。

貴也寫在物料清單上。業界估算 Blackwell 的製造成本大約是 H100 的兩倍,其中 HBM 接近一半。芯片漲價,經常是內存在漲。

信號 2026 年中的事實 口徑
HBM3e @ Blackwell 約佔 GPU 物料成本 45%–50% 供應鏈 / BOM 拆解
HBM4 2026 全年產能售罄,客戶到手約 60%–70% Micron / TrendForce
AI 服務器漲價 對 Vera Rubin / Grace Blackwell 配置通知 >15%,2027 年初出貨生效 NVIDIA / Bloomberg / CNBC
現有客戶訂單滿足率 ~70% NVIDIA Q2 FY2027

2026 年 8 月下旬,NVIDIA 在財報裏用「極端」形容內存成本,並下調毛利率指引。這不是公關修辭。HBM 供應商只有 SK hynix、三星和美光三家能量產先進堆疊;12 高 HBM4E 的良率和認證還不確定,Rubin Ultra 甚至在評估降規格。

內存廠的定價權會一直維持到供給追上需求。開發者能做的不是「等 HBM 降價」,而是少浪費顯存:量化、投機解碼、更短的默認上下文,以及把 KV cache 當一等公民來記賬。官方產品頁見 SK hynix HBM

數據中心:電、冷卻和土地比芯片更慢

就算明天 HBM 夠用,機房也跟不上。一張 1000W 的 B200 已經不便宜;72 張 GPU 鎖進一個 NVLink 域,整櫃要 120–130 kW 液冷。門框、樓板荷載、冷卻迴路和變電站,都不是下單就能加速的東西。

IEA Energy and AI 預計全球數據中心用電將在 2030 年前後翻倍,AI 優化機房的增速更快。Epoch AI 與 EPRI 的估算是:前沿訓練功率已超過 100 MW,並可能以每年 2.2–2.9 倍增長,2028 年單次訓練到 1–2 GW。電,比晶圓更難搬家。

  1. 1
    功率密度改寫機房

    舊機櫃按 10–20 kW 設計。GB200 一類機櫃直接跳到 120 kW 以上,風冷不夠,必須上液冷和更粗的配電。

  2. 2
    變電站和輸電更慢

    芯片交期以季度計,高壓接入以年計。很多「已下單的 GPU」會先在倉庫或分階段上電,不是因爲不想用,是因爲電還沒接到。

  3. 3
    選址變成能源問題

    超大規模買家在追核電協議、燃氣調峯和自建發電。土地便宜但沒有多餘電力的地方,建不成 AI 工廠。

  4. 4
    推理把峯值攤成基荷

    訓練是幾個月的脈衝;聊天、搜索和 Agent 是全年基荷。IEA 的口徑裏,AI 服務器用電增量裏接近一半來自推理。

所以「再買一萬張 GPU」經常不是採購問題,是電網問題。算力戰爭的前線,有一半畫在電業地圖上。

大模型算力戰爭:訓練一次,推理每天

Epoch AI 2024 估過:2016 年以來,最喫算力的訓練攤銷成本大約每年乘 2.4 倍。那時 GPT-4 量級的公開估算還在數千萬美元;按同一斜率,前沿訓練在 2027 年前後會跨過十億美元。2026 年的新變量是推理:推理模型和 test-time compute 讓「一次回答」變成「很多次前向」。

階段 誰在付錢 2026 年的變化
預訓練 少數實驗室 + 雲/芯片合同 單次訓練功率已到百兆瓦;多機房訓練開始出現
後訓練 / 強化學習 同一批實驗室,賬單更碎 推理軌跡本身要佔 GPU;「訓練」和「推理」的邊界變糊
在線推理 所有產品用戶 佔 AI 算力 80%–90%;長上下文和推理鏈直接喫 HBM

這就是爲什麼 API 單價不一定跟着「下一張卡更快」往下掉。卡更快,但每次請求走的步數更多,住在 HBM 裏的狀態也更大。單位 FLOPS 在便宜,單位有用回答不一定。

開源這邊同樣要付賬。權重可以免費下,集羣不能。誰控制默認的發現入口和推理套餐,誰就更接近定價權——這也是 NVIDIA 願意花 129 億美元買 Hugging Face 的背景。

對開發者意味着什麼

從今天到 2027,該改的是用法,不是情懷。下面四件事比「再等一降價」有用。

  1. 1
    把上下文和推理深度當成本旋鈕

    默認 128K 上下文和默認「想久一點」會直接轉化成 HBM 和 GPU 小時。產品層設上限,比在賬單出來後驚訝更便宜。

  2. 2
    區分實驗集羣和生產集羣

    評測、掃描和一次性微調走現貨或搶佔;生產推理走預留。混在同一張 on-demand 賬單裏,是最貴的用法。

  3. 3
    開權重省的是毛利,不是電

    本地部署仍然要買或租 GPU。把 revision 和 license 釘死,參考 NVIDIA 收購 Hugging Face,比假設 Hub 永遠免費託管更穩。

  4. 4
    用 JSON 把賬單變成可校驗的契約

    雲發票、內部 GPU 庫存和 token 用量最終都是 JSON。字段對不上,你就沒法回答「貴在哪一層」。

成本賬單裏的 JSON 長什麼樣

股權新聞和財報口徑幫不了你對賬。你真正能操作的,是每月從雲廠商或內部平臺拉下來的用量對象。

下面是一份可以本地校驗的月度賬單形狀——字段名常見於內部成本系統,數字是示例,不是某家雲的真實發票。

月度 GPU 推理賬單(示例,不是真實發票)
{
  "period": "2026-08",
  "cluster": "inference-prod-1",
  "sku": "H200-SXM",
  "gpu_count": 64,
  "gpu_hours": 18432,
  "usd_per_gpu_hour": 3.95,
  "power_kwh": 12902,
  "usd_per_kwh": 0.08,
  "tokens_out": 4120000000,
  "currency": "USD"
}

有了這張對象,才能回答三個問題:這個月 GPU 小時乘單價是多少、電費佔多少、每個輸出 token 均攤多少。缺 sku 或把 gpu_hours 寫成字符串,後面的報表都會漂。

校驗成本對象的 JSON Schema 草稿
{
  "$schema": "https://json-schema.org/draft/2020-12/schema",
  "type": "object",
  "required": [
    "period", "sku", "gpu_hours",
    "usd_per_gpu_hour", "currency"
  ],
  "properties": {
    "period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
    "cluster": { "type": "string", "minLength": 1 },
    "sku": { "type": "string", "minLength": 1 },
    "gpu_count": { "type": "integer", "minimum": 1 },
    "gpu_hours": { "type": "number", "minimum": 0 },
    "usd_per_gpu_hour": { "type": "number", "minimum": 0 },
    "power_kwh": { "type": "number", "minimum": 0 },
    "usd_per_kwh": { "type": "number", "minimum": 0 },
    "tokens_out": { "type": "integer", "minimum": 0 },
    "currency": { "type": "string", "enum": ["USD"] }
  },
  "additionalProperties": false
}

同一套習慣也適用於模型 API 的 usage 字段:prompt_tokens、completion_tokens、reasoning_tokens。先校驗形狀,再談優化。

用 JSONNote 覈對賬單

慢的部分很少是寫公式。慢的是看見兩份 JSON 在哪一行對不上。JSONNote 在瀏覽器本地運行:

  1. 1
    先格式化發票

    把雲導出或內部 API 的用量對象貼進 JSON 格式化,先排除語法和縮進噪音。

  2. 2
    用 schema 卡住必填字段

    把上面的草稿貼到 JSON Schema 頁,確認 period、sku、gpu_hours 和單價還在。

  3. 3
    對比兩個月

    JSON Diff 看 sku 有沒有從 H100 換成 H200、單價和 gpu_hours 哪一項在漲。

  4. 4
    需要給同事看時再分享

    Hash 分享 把示例(不要放密鑰)放進 URL fragment,數據不經過服務器。

常見問題

AI 變貴只是因爲 GPU 漲價嗎?

不是。GPU 只是最顯眼的一層。HBM、CoWoS 封裝、電力、液冷和變電站週期都在漲。NVIDIA 2026 年 8 月把部分 AI 服務器提價超過 15%,主因寫明是內存成本。

HBM 是什麼,爲什麼比芯片還緊?

HBM 是堆疊在 GPU 旁邊的高帶寬內存。大模型的權重和 KV cache 都住在這裏。Blackwell 一代裏 HBM 大約佔物料成本的 45%–50%。SK hynix、三星、美光 2026 年 HBM4 基本售罄,客戶只能拿到訂單的 60%–70%。

訓練貴,還是推理貴?

訓練是一次性的天價賬單;推理是每天都在發生的賬單。業界估計 AI 算力的 80%–90% 已經花在推理上。推理模型的 test-time compute 會把「一次回答」變成「很多次前向」,HBM 和 GPU 小時一起漲。

自己買卡划算,還是租雲?

看利用率。集羣日利用率長期高於約 60%–70%,買斷或長期預留通常更便宜;突發微調、評測和實驗更適合按小時租。不要拿一張卡的標價去和 hyperscaler 的 on-demand 比,渠道價差本身就有數倍。

開源模型能躲開這筆賬嗎?

躲不開。開權重省的是 API 毛利,不是 GPU、HBM 和電。權重免費下載之後,仍然要有人付錢跑它。分發入口甚至可能更貴——參見 NVIDIA 收購 Hugging Face 的交易。

總結

AI 越來越貴,是因爲需求壓在四樣短的東西上:NVIDIA GPU、HBM、先進封裝,以及接得上電的機櫃。

用戶付 token,公司付 GPU 小時和兆瓦。HBM 已經寫進服務器漲價通知。

開發者能做的,是把上下文、推理深度和集羣類型寫成可校驗的 JSON,而不是等下一張卡自動降價。在 JSONNote 裏格式化、校驗、Diff——密鑰和賬單都不必上傳。

← 返回博客