ブログ • AI / 計算資源
AI はなぜ高くなっているのか?NVIDIA GPU、HBM、データセンターと大規模モデルの計算戦争
AI が高くなっているのは、チャット画面が急に有料になったからではない。「より良い」回答のたびに GPU、HBM、電力、ラックを余分に焼くからだ。2026 年半ば、H100 はまだ 2.5–4 万ドル、H200 と B200 はさらに上、GB200 NVL72 1 ラックは 200–340 万ドルだ。
NVIDIA は既存顧客需要の約 70% しか満たせないと言う。2026 年 8 月、メモリコストで一部 AI サーバを 15% 超値上げすると大口に通知した。不足は「カードが無い」から「カード・メモリ・電力が同時に上がる」へ移った。
ユーザーが見るのは token 単価。会社の帳簿は GPU 時間、HBM 容量、メガワットだ。この二系統が揃わなければ議論はスローガンで止まる。
この記事では:
- 高いのはモデルではなく計算サプライチェーン全体
- H100 から GB300 までの NVIDIA 価格階段
- HBM が本当のボトルネックになった理由
- データセンターの電力・冷却・立地がチップより遅い理由
- 学習は一度、推論は毎日。請求書の JSON の読み方
まずこれだけ:ユーザーは token を払い、会社は GPU 時間、HBM、メガワットを払う。以下は「サプライチェーン → GPU → HBM → 施設 → 学習/推論 → 開発者の請求」の順で分解する。
高くなったのはモデルではない
まず「AI が高い」を六層に分ける。層ごとに売っているものと詰まる場所が違う。重ねたものが 2026 年の請求書だ。
| 層 | 何を売るか | 2026 年の詰まり |
|---|---|---|
| モデル | 重み、ライセンス、評価 | オープンウェイトは無料では走らない。配布入口はチップ企業が買い始めている |
| GPU | アクセラレータとシステム | 供給は需要の約 70%。単価は下がらない |
| HBM | 重みと KV cache の住所 | Blackwell BOM の約半分。HBM4 は 2027 まで完売 |
| CoWoS | ロジックダイと HBM を接合する | TSMC CoWoS の納期は 52 週超。2026–2027 まで予約済み |
| データセンター | 土地、変電所、液冷、ラック | GB200 1 ラックは 120–130 kW。電力はシリコンより遅い |
| Token / API | 都度課金のインタフェース | 表示価格は動かせるが、GPU 時間と電力量は一緒に下がらない |
だから「AI はなぜ高い」は製品の問いではない。モデルは公開でき、API は値引きできる。HBM 積層、CoWoS、変電所増強には同じ割引が無い。
NVIDIA GPU:1 枚のカードから 1 ラックへ
NVIDIA はデータセンター GPU の公式価格表を出さない。市中、OEM、クラウドの見積は何倍も違う。下表は 2026 年 7 月前後の市場レンジを、NVIDIA H200 と GB200 NVL72 の公開仕様に照らしたものだ。区間であり、請求書ではない。
表を読むときは二つを分ける。買うのはチップかラックか。払うのは一度の設備投資か、時間貸しの賃料か。
| SKU | アーキテクチャ | HBM | 購入価格(およそ) | クラウド賃料 中央値/区間(GPU 時間あたり) |
|---|---|---|---|---|
| H100 SXM5 | Hopper | 80GB HBM3 / 3.35 TB/s | $25,000–$40,000 | ~$2.29 |
| H200 SXM | Hopper | 141GB HBM3e / 4.8 TB/s | $30,000–$40,000 | ~$3.95 |
| B200 SXM6 | Blackwell | 180–192GB HBM3e / 8 TB/s | $40,000–$45,000 | $3.75–$9.86 |
| GB200 NVL72 | Blackwell rack | 13.4TB / 72 GPU | $2M–$3.4M | $10.50–$27.00 |
| GB300 NVL72 | Blackwell Ultra | 288GB HBM3e / GPU | $3.7M–$4M | — |
H100 から B200 へはカード単価が一段上がるだけだ。カードから GB200 NVL72 へは購入単位が変わる。アクセラレータではなく、液冷・120–130 kW・約 1.36 トンのシステムを買う。次世代 Vera Rubin NVL72 の巷間評価は 1 ラック約 880 万ドルだ。
クラウドの開きも大きい。H100 on-demand の中央値は約 $2.29/時(観測 $1.38–$11.06)。H200 は約 $3.95——上乗せの大半は 141GB HBM3e であり、FLOPS ではない。B200 はまだ逼迫し $3.75–$9.86。GB200 ラックは GPU あたり $10.50–$27.00 になり得る。
NVIDIA の FY2027 Q1 データセンター売上は 752 億ドル、前年比 +92%。アナリストは AI アクセラレータ売上シェアをなお 75%–90% と見る。GeForce のように下がらない。需要が供給の上に乗っているからだ。
HBM:詰まるのはメモリ
大規模モデルが食うのは FLOPS だけではない。重みはメモリに入り、推論時に KV cache が伸び続ける。文脈が長く、MoE が大きく、推論ステップが多いほど HBM は逼迫する。H100 は 80GB HBM3、H200 は同世代で 141GB HBM3e、B200 は 180–192GB。帯域は 3.35 TB/s から 8 TB/s へ跳ねる。
高さは BOM にも書いてある。Blackwell の製造原価は H100 の約 2 倍、うち HBM が半分近いという試算がある。チップが値上がりするとき、動いている行はしばしばメモリだ。
| 信号 | 2026 年半ばの事実 | 口径 |
|---|---|---|
| HBM3e @ Blackwell | GPU BOM の約 45%–50% | サプライチェーン / BOM 分解 |
| HBM4 2026 | 通年生産は完売、顧客着荷は約 60%–70% | Micron / TrendForce |
| AI サーバ値上げ | Vera Rubin / Grace Blackwell 構成で >15%、2027 年初出荷から適用 | NVIDIA / Bloomberg / CNBC |
| 既存顧客の充足率 | ~70% | NVIDIA Q2 FY2027 |
2026 年 8 月下旬、NVIDIA は決算でメモリコストを「極端」と呼び、粗利率ガイダンスを下げた。広報ではない。先端スタックを量産できるのは SK hynix、Samsung、Micron だけだ。12 段 HBM4E の歩留まりと認定は未確定で、Rubin Ultra はスペックダウンも検討されている。
供給が需要に追いつくまで、メモリメーカーが価格決定権を持つ。開発者ができるのは「HBM の値下がり待ち」ではなく、メモリを無駄にしないことだ。量子化、投機的デコード、短い既定コンテキスト、KV cache を第一級コストとして数えること。公式製品ページは SK hynix HBM。
データセンター:電力・冷却・土地はチップより遅い
明日 HBM が緩んでも、ホールは追いつかない。1000W の B200 ですら扱いにくい。72 GPU を一つの NVLink ドメインに閉じれば、ラックは 120–130 kW の液冷を要求する。扉、床荷重、冷却ループ、変電所は発注書では速くならない。
IEA Energy and AI は世界のデータセンター電力が 2030 年頃にほぼ倍増し、AI 最適化ホールはさらに速いと見る。Epoch AI と EPRI は、最先端学習がすでに 100 MW 超で、年 2.2–2.9 倍、2028 年には 1 回 1–2 GW になり得ると試算する。電気はウエハより引っ越しにくい。
-
1
電力密度がホールを書き換える
旧ラックは 10–20 kW 前提だ。GB200 級は 120 kW 超。空冷では足りず、液冷と太い配電が要る。
-
2
変電所と送電はもっと遅い
チップ納期は四半期、高圧連系は年単位。「発注済み GPU」の多くは倉庫か段階通電になる。使いたくないのではなく、電気がまだ来ていない。
-
3
立地はエネルギー問題になる
ハイパースケーラは原子力 PPA、ガスピーカー、構内発電を追う。土地が安くても余力メガワットが無い場所に AI 工場は建たない。
-
4
推論がピークをベースロードにする
学習は数か月のパルス。チャット、検索、エージェントは通年のベースロードだ。IEA の口径では、AI サーバ電力増分の半分近くが推論だ。
だから「GPU をあと 1 万枚」は調達の問いではなく、しばしば系統の問いだ。計算戦争の前線の半分は電力地図にある。
計算戦争:学習は一度、推論は毎日
Epoch AI 2024 は、2016 年以降、最も計算を食う学習の償却コストが年約 2.4 倍と試算した。当時の GPT-4 級の公開数字はまだ数千万ドル、同じ傾きなら 2027 年前後に十億ドルを超える。2026 年の新しい変数は推論だ。推論モデルと test-time compute は「1 回の回答」を「何度もの forward」に変える。
| 段階 | 誰が払うか | 2026 年の変化 |
|---|---|---|
| 事前学習 | 少数の研究室 + クラウド/チップ契約 | 1 回で百 MW 級。複数キャンパス学習が現れ始めている |
| 事後学習 / 強化学習 | 同じ研究室、より細切れの請求 | ロールアウト自体が GPU を食う。学習と推論の境界がぼやける |
| オンライン推論 | すべてのプロダクトユーザー | AI 計算の 80%–90%。長い文脈と推論チェーンが HBM を直接食う |
だから「次のカードが速い」だけでは API 単価は自動では下がらない。カードは速いが、各リクエストのステップは増え、HBM 上の状態も大きい。FLOP は安くなっても、使える回答は安くならないことがある。
オープンソース側も払う。重みは無料で落とせても、クラスタは落とせない。既定の発見入口と推論 SKU を握る者が価格に近い。NVIDIA が Hugging Face に 129 億ドルを払う背景でもある。
開発者にとっての意味
今から 2027 年まで、変えるべきは情怀ではなく使い方だ。値下げ待ちより、次の四つの方が効く。
-
1
文脈と推論の深さをコストつまみにする
既定 128K と既定の「もっと考える」は、そのまま HBM と GPU 時間になる。請求書を見て驚くより、プロダクト層で上限を付ける方が安い。
-
2
実験クラスタと本番クラスタを分ける
評価、スイープ、一度きりのファインチューンはスポットやプリエンプトへ。本番推論は予約へ。同じ on-demand 請求に混ぜるのが一番高い使い方だ。
-
3
オープンウェイトが省くのは粗利であり電気ではない
自前運用でも GPU は買うか借りる。revision と license を固定し、NVIDIA の Hugging Face 買収 を参考にする方が、Hub が永遠に無料でホストすると仮定するより安全だ。
-
4
請求を検証可能な JSON 契約にする
クラウド請求、内部 GPU 在庫、token 使用量は最終的に JSON だ。フィールドが揃わなければ、「どの層が高いか」に答えられない。
コスト請求の JSON の形
買収ニュースと決算トークでは突合できない。操作できるのは、クラウドや内部基盤から毎月落ちてくる使用量オブジェクトだ。
以下はローカルで検証できる月次請求の形だ。フィールド名は内部コストシステムでよく見るもので、数値は例であり実在の請求ではない。
{
"period": "2026-08",
"cluster": "inference-prod-1",
"sku": "H200-SXM",
"gpu_count": 64,
"gpu_hours": 18432,
"usd_per_gpu_hour": 3.95,
"power_kwh": 12902,
"usd_per_kwh": 0.08,
"tokens_out": 4120000000,
"currency": "USD"
}
このオブジェクトがあれば、GPU 時間×単価、電力費、出力 token あたり原価の三つに答えられる。sku が欠ける、gpu_hours が文字列になる、その時点で下流レポートは漂う。
{
"$schema": "https://json-schema.org/draft/2020-12/schema",
"type": "object",
"required": [
"period", "sku", "gpu_hours",
"usd_per_gpu_hour", "currency"
],
"properties": {
"period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
"cluster": { "type": "string", "minLength": 1 },
"sku": { "type": "string", "minLength": 1 },
"gpu_count": { "type": "integer", "minimum": 1 },
"gpu_hours": { "type": "number", "minimum": 0 },
"usd_per_gpu_hour": { "type": "number", "minimum": 0 },
"power_kwh": { "type": "number", "minimum": 0 },
"usd_per_kwh": { "type": "number", "minimum": 0 },
"tokens_out": { "type": "integer", "minimum": 0 },
"currency": { "type": "string", "enum": ["USD"] }
},
"additionalProperties": false
}
同じ習慣はモデル API の usage にも使える。prompt_tokens、completion_tokens、reasoning_tokens。形を検証してから最適化する。
JSONNote で請求を照合する
遅いのは式を書くことではない。二件の JSON のどの行が違うかを見ることだ。JSONNote はブラウザローカルで動く:
-
1
まず請求を整形する
クラウド書き出しや内部 API の使用量を JSON 整形 に貼り、構文とインデントのノイズを先に消す。
-
2
schema で必須フィールドを固定する
上の草案を JSON Schema ページに貼り、period、sku、gpu_hours、単価が残っているか確認する。
-
3
二か月を比べる
JSON Diff で sku が H100 から H200 に変わったか、単価と gpu_hours のどちらが上がったかを見る。
-
4
同僚が必要なときだけ共有する
Hash 共有 でサンプル(秘密は入れない)を URL fragment に載せる。サーバには届かない。
よくある質問
AI が高くなったのは GPU の値上げだけですか?
いいえ。GPU は一番目立つ層です。HBM、CoWoS、電力、液冷、変電所のリードタイムも上がっています。NVIDIA は 2026 年 8 月、メモリコストを理由に一部 AI サーバを 15% 超値上げすると大口顧客に通知しました。
HBM とは何で、なぜチップより逼迫しているのですか?
HBM は GPU の隣に積まれる高帯域メモリです。重みと KV cache がそこに住みます。Blackwell では BOM の約 45%–50% です。SK hynix、Samsung、Micron の 2026 年 HBM4 はほぼ完売で、顧客は発注量の約 60%–70% しか受け取れません。
高いのは学習ですか、推論ですか?
学習は一度きりの巨額請求、推論は毎日届く請求です。AI 計算の 80%–90% は推論という見積もりがあります。test-time compute は「1 回の回答」を「何度もの forward」に変え、HBM と GPU 時間が同時に増えます。
カードを買うのとクラウドを借りるの、どちらが得ですか?
稼働率次第です。クラスタが長期で約 60%–70% を超えるなら購入や予約が有利で、突発のファインチューンや評価は時間貸し向きです。街のカード価格とハイパースケーラの on-demand を直接比べないでください。販路差だけで数倍あります。
オープンソースモデルならこの請求を避けられますか?
避けられません。オープンウェイトが省くのは API 粗利であり、GPU・HBM・電力ではありません。無料ダウンロードのあと、誰かが実行費用を払います。配布入口はむしろ高くなる可能性があります。NVIDIA の Hugging Face 買収を見てください。
まとめ
AI が高くなっているのは、需要が四つの短いもの——NVIDIA GPU、HBM、先端パッケージ、電力を受け取れるラック——に積み上がっているからだ。
ユーザーは token を払い、会社は GPU 時間とメガワットを払う。HBM はすでにサーバ値上げ通知に書かれている。
開発者ができるのは、文脈、推論の深さ、クラスタ種別を検証可能な JSON に書くことであり、次のカードが勝手に値下げするのを待つことではない。JSONNote で整形、検証、Diff する。秘密も請求もアップロードしなくてよい。