블로그 • AI / 연산
AI는 왜 점점 비싸지는가? NVIDIA GPU, HBM, 데이터센터와 대규모 모델 연산 전쟁
AI가 비싸지는 것은 채팅 창이 갑자기 유료가 되어서가 아니다. 「더 나은」 답마다 GPU, HBM, 전력, 랙을 더 태우기 때문이다. 2026년 중반, H100은 여전히 25,000–40,000달러, H200과 B200은 더 위, GB200 NVL72 한 랙은 200–340만 달러다.
NVIDIA는 기존 고객 수요의 약 70%만 채울 수 있다고 말한다. 2026년 8월, 메모리 비용 때문에 일부 AI 서버를 15% 넘게 올린다고 대고객에 알렸다. 부족은 「카드가 없다」에서 「카드, 메모리, 전력이 함께 오른다」로 옮겼다.
사용자가 보는 것은 토큰 단가다. 회사 장부는 GPU시간, HBM 용량, 메가와트다. 이 두 숫자 체계가 맞지 않으면 논의는 구호에서 멈춘다.
이 글에서는:
- 비싼 것은 한 모델이 아니라 연산 공급망 전체다
- H100에서 GB300까지 NVIDIA 가격 계단
- HBM이 진짜 병목이 된 이유
- 데이터센터의 전력, 냉각, 입지가 칩보다 느린 이유
- 학습은 한 번, 추론은 매일. 청구서를 JSON으로 읽는 법
이것만 기억하세요: 사용자는 토큰을 내고, 회사는 GPU시간, HBM, 메가와트를 낸다. 아래는 공급망 → GPU → HBM → 설비 → 학습/추론 → 개발자 청구서로 나눈다.
비싸진 것은 모델이 아니다
먼저 「AI가 비싸다」를 여섯 층으로 나눈다. 층마다 파는 것과 막히는 곳이 다르다. 겹친 것이 2026년 청구서다.
| 층 | 무엇을 파는가 | 2026년의 병목 |
|---|---|---|
| 모델 | 가중치, 라이선스, 평가 | 오픈 웨이트는 무료로 돌리지 못한다. 배포 입구는 칩 업체가 사들이고 있다 |
| GPU | 가속기와 시스템 | 공급은 수요의 약 70%. 단가는 떨어지지 않는다 |
| HBM | 가중치와 KV cache의 주소 | Blackwell BOM의 약 절반. HBM4는 2027까지 완판 |
| CoWoS | 로직 다이와 HBM을 붙이는 일 | TSMC CoWoS 리드타임은 52주를 넘고, 2026–2027까지 예약됐다 |
| 데이터센터 | 토지, 변전소, 액냉, 랙 | GB200 한 랙은 120–130 kW. 전력은 실리콘보다 느리다 |
| Token / API | 호출당 과금 인터페이스 | 표시 가격은 움직일 수 있지만 GPU시간과 전력량은 같이 떨어지지 않는다 |
그래서 「AI는 왜 점점 비싼가」는 제품 질문이 아니다. 모델은 공개할 수 있고 API는 할인할 수 있다. HBM 적층, CoWoS, 변전소 증설에는 같은 할인이 없다.
NVIDIA GPU: 카드 한 장에서 랙 하나로
NVIDIA는 데이터센터 GPU 공식 가격표를 내지 않는다. 시중, OEM, 클라우드 견적은 몇 배씩 다르다. 아래 표는 2026년 중반 시장 구간을 NVIDIA H200 및 GB200 NVL72 공개 사양에 맞춘 것이다. 구간이지 청구서가 아니다.
표를 읽을 때는 둘을 가른다. 사는 것은 칩인가 랙인가. 내는 것은 한 번의 설비투자인가, 시간당 임대인가.
| SKU | 아키텍처 | HBM | 구매가(대략) | 클라우드 임대 중앙값/구간(GPU시간당) |
|---|---|---|---|---|
| H100 SXM5 | Hopper | 80GB HBM3 / 3.35 TB/s | $25,000–$40,000 | ~$2.29 |
| H200 SXM | Hopper | 141GB HBM3e / 4.8 TB/s | $30,000–$40,000 | ~$3.95 |
| B200 SXM6 | Blackwell | 180–192GB HBM3e / 8 TB/s | $40,000–$45,000 | $3.75–$9.86 |
| GB200 NVL72 | Blackwell rack | 13.4TB / 72 GPU | $2M–$3.4M | $10.50–$27.00 |
| GB300 NVL72 | Blackwell Ultra | 288GB HBM3e / GPU | $3.7M–$4M | — |
H100에서 B200까지는 카드 스티커 가격이 한 단 오를 뿐이다. 카드에서 GB200 NVL72로 가면 구매 단위가 바뀐다. 가속기가 아니라 액냉, 120–130 kW, 1.36톤 시스템을 산다. 다음 Vera Rubin NVL72의 시중 평가는 랙당 약 880만 달러다.
클라우드 격차도 크다. H100 온디맨드 중앙값은 약 $2.29/시간(관측 $1.38–$11.06). H200은 약 $3.95——가산의 대부분은 141GB HBM3e이지 더 많은 FLOPS가 아니다. B200은 아직 빠듯해 $3.75–$9.86. GB200 랙은 GPU당 $10.50–$27.00가 될 수 있다.
NVIDIA의 FY2027 Q1 데이터센터 매출은 752억 달러, 전년 대비 +92%. 분석가는 AI 가속기 매출 점유율을 여전히 75%–90%로 본다. GeForce처럼 내려가지 않는다. 수요가 공급 위에 앉아 있기 때문이다.
HBM: 목조르는 것은 메모리
대규모 모델이 먹는 것은 FLOPS만이 아니다. 가중치는 메모리에 들어가야 하고, 추론 때 KV cache는 계속 커진다. 컨텍스트가 길고, MoE가 크고, 추론 스텝이 많을수록 HBM은 빠듯해진다. H100은 80GB HBM3, H200은 같은 세대에서 141GB HBM3e, B200은 180–192GB. 대역폭은 3.35 TB/s에서 8 TB/s로 뛴다.
비쌈은 자재 명세에도 적혀 있다. Blackwell 제조 원가는 H100의 대략 두 배이고, 그중 HBM이 절반에 가깝다는 추산이 있다. 칩이 오를 때 움직인 줄은 종종 메모리다.
| 신호 | 2026년 중반의 사실 | 출처 표현 |
|---|---|---|
| HBM3e @ Blackwell | GPU BOM의 약 45%–50% | 공급망 / BOM 분해 |
| HBM4 2026 | 연간 생산은 완판, 고객 입고는 약 60%–70% | Micron / TrendForce |
| AI 서버 인상 | Vera Rubin / Grace Blackwell 구성에서 >15%, 2027년 초 출하부터 적용 | NVIDIA / Bloomberg / CNBC |
| 기존 고객 충족률 | ~70% | NVIDIA Q2 FY2027 |
2026년 8월 하순, NVIDIA는 실적 발표에서 메모리 비용을 「극단적」이라고 부르고 매출총이익률 가이던스를 내렸다. 홍보 수사가 아니다. 첨단 스택을 양산하는 곳은 SK hynix, Samsung, Micron뿐이다. 12단 HBM4E 수율과 인증은 아직 불확실하고, Rubin Ultra는 스펙 하향까지 검토 중이다.
공급이 수요를 따라잡을 때까지 메모리 업체가 가격 결정권을 가진다. 개발자가 할 일은 「HBM 인하를 기다리는 것」이 아니라 메모리를 덜 낭비하는 것이다. 양자화, 추측 디코딩, 더 짧은 기본 컨텍스트, KV cache를 일급 비용으로 세기. 공식 제품 페이지는 SK hynix HBM.
데이터센터: 전력, 냉각, 토지가 칩보다 느리다
내일 HBM이 풀려도 홀은 따라가지 못한다. 1,000 W B200만으로도 다루기 어렵다. 72개 GPU를 하나의 NVLink 도메인에 잠그면 랙은 120–130 kW 액냉을 요구한다. 문틀, 바닥 하중, 냉각 루프, 변전소는 발주서를 냈다고 빨라지지 않는다.
IEA Energy and AI 은 세계 데이터센터 전력이 2030년 무렵 거의 두 배가 되고, AI 최적화 홀은 더 빠르다고 본다. Epoch AI 와 EPRI는 최전선 학습이 이미 100 MW를 넘고 해마다 2.2–2.9배, 2028년에는 한 번에 1–2 GW가 될 수 있다고 추산한다. 전기는 웨이퍼보다 옮기기 어렵다.
-
1
전력 밀도가 홀을 다시 쓴다
구형 랙은 10–20 kW용이다. GB200급 캐비닛은 120 kW를 넘는다. 공냉으로는 부족하고 액냉과 더 굵은 전력이 필요하다.
-
2
변전소와 송전은 더 느리다
칩 납기는 분기 단위, 고압 연계는 연 단위다. 「발주된 GPU」 상당수는 창고에 있거나 단계 통전된다. 쓰기 싫어서가 아니라 전기가 아직 안 왔기 때문이다.
-
3
입지는 에너지 문제가 된다
하이퍼스케일러는 원전 PPA, 가스 피커, 구내 발전을 쫓는다. 땅이 싸도 여유 메가와트가 없는 곳에는 AI 공장이 서지 않는다.
-
4
추론이 피크를 기저부하로 만든다
학습은 몇 달짜리 펄스다. 채팅, 검색, 에이전트는 연중 기저부하다. IEA의 집계에서는 AI 서버 전력 증가분의 거의 절반이 추론이다.
그래서 「GPU를 1만 장 더 사자」는 종종 조달 질문이 아니라 계통 질문이다. 연산 전쟁의 전선 절반은 전력 지도에 그려져 있다.
연산 전쟁: 학습은 한 번, 추론은 매일
Epoch AI 2024 는 2016년 이후 가장 연산을 많이 쓰는 학습의 상각 비용이 해마다 약 2.4배라고 추산했다. 당시 GPT-4급 공개 숫자는 아직 수천만 달러였고, 같은 기울기면 2027년 무렵 10억 달러를 넘는다. 2026년의 새 변수는 추론이다. 추론 모델과 test-time compute는 「한 번의 답」을 「여러 번의 순전파」로 바꾼다.
| 단계 | 누가 내는가 | 2026년의 변화 |
|---|---|---|
| 사전학습 | 소수의 랩 + 클라우드/칩 계약 | 한 번에 이미 수백 메가와트. 다중 캠퍼스 학습이 나타나기 시작했다 |
| 사후학습 / 강화학습 | 같은 랩, 더 잘게 쪼개진 청구 | 롤아웃 자체가 GPU를 먹는다. 학습과 추론의 경계가 흐려진다 |
| 온라인 추론 | 모든 제품 사용자 | AI 연산의 80%–90%. 긴 컨텍스트와 추론 체인이 HBM을 직접 먹는다 |
그래서 「다음 카드가 더 빠르다」만으로 API 단가가 자동으로 떨어지지 않는다. 카드는 빠르지만 요청마다 스텝이 늘고 HBM에 남는 상태도 크다. FLOP은 싸져도 쓸모 있는 답이 싸지지 않을 수 있다.
오픈소스 쪽도 낸다. 가중치는 무료로 받을 수 있어도 클러스터는 못 받는다. 기본 발견 입구와 추론 SKU를 쥔 쪽이 가격에 가깝다. NVIDIA가 Hugging Face에 129억 달러를 쓰는 배경이기도 하다.
개발자에게 의미하는 것
지금부터 2027년까지 바꿀 것은 감정이 아니라 쓰는 방식이다. 인하를 기다리는 것보다 다음 네 가지가 낫다.
-
1
컨텍스트와 추론 깊이를 비용 노브로 취급하라
기본 128K 창과 기본 「더 오래 생각하기」는 바로 HBM과 GPU시간이 된다. 청구서를 보고 놀라는 것보다 제품 층에서 상한을 거는 편이 싸다.
-
2
실험 클러스터와 운영 클러스터를 나눠라
평가, 스윕, 일회 파인튜닝은 스팟이나 선점형으로. 운영 추론은 예약으로. 같은 온디맨드 청구에 섞는 것이 가장 비싼 습관이다.
-
3
오픈 웨이트가 아끼는 것은 마진이지 전기가 아니다
자체 호스팅도 GPU를 사거나 빌려야 한다. revision과 license를 고정하고 NVIDIA의 Hugging Face 인수 를 참고하는 편이, Hub가 영원히 무료 호스팅한다고 가정하는 것보다 안전하다.
-
4
청구서를 검증 가능한 JSON 계약으로 바꿔라
클라우드 청구, 내부 GPU 재고, 토큰 사용량은 결국 JSON이다. 필드가 맞지 않으면 「어느 층이 비싸졌는지」에 답할 수 없다.
비용 청구서의 JSON 모양
인수 헤드라인과 실적 표현으로는 장부를 맞출 수 없다. 다룰 수 있는 것은 클라우드나 내부 플랫폼에서 매달 떨어지는 사용량 객체다.
아래는 로컬에서 검증할 수 있는 월간 청구 형태다. 필드명은 내부 비용 시스템에서 흔히 보고, 숫자는 예이며 실제 클라우드 청구가 아니다.
{
"period": "2026-08",
"cluster": "inference-prod-1",
"sku": "H200-SXM",
"gpu_count": 64,
"gpu_hours": 18432,
"usd_per_gpu_hour": 3.95,
"power_kwh": 12902,
"usd_per_kwh": 0.08,
"tokens_out": 4120000000,
"currency": "USD"
}
이 객체가 있으면 GPU시간×단가, 전력비, 출력 토큰당 원가 세 가지에 답할 수 있다. sku가 빠지거나 gpu_hours가 문자열이 되면 이후 리포트는 모두 떠다닌다.
{
"$schema": "https://json-schema.org/draft/2020-12/schema",
"type": "object",
"required": [
"period", "sku", "gpu_hours",
"usd_per_gpu_hour", "currency"
],
"properties": {
"period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
"cluster": { "type": "string", "minLength": 1 },
"sku": { "type": "string", "minLength": 1 },
"gpu_count": { "type": "integer", "minimum": 1 },
"gpu_hours": { "type": "number", "minimum": 0 },
"usd_per_gpu_hour": { "type": "number", "minimum": 0 },
"power_kwh": { "type": "number", "minimum": 0 },
"usd_per_kwh": { "type": "number", "minimum": 0 },
"tokens_out": { "type": "integer", "minimum": 0 },
"currency": { "type": "string", "enum": ["USD"] }
},
"additionalProperties": false
}
같은 습관은 모델 API usage 필드에도 적용된다. prompt_tokens, completion_tokens, reasoning_tokens. 모양을 검증한 뒤에 최적화하라.
JSONNote로 청구서 대조하기
느린 부분은 공식을 쓰는 일이 거의 아니다. 두 JSON의 어느 줄이 갈라지는지를 보는 일이다. JSONNote는 브라우저 로컬에서 동작한다:
-
1
먼저 청구서를 포맷하라
클라우드 내보내기나 내부 사용량 객체를 JSON 포맷 에 붙여 구문과 들여쓰기 노이즈를 먼저 걷어낸다.
-
2
schema로 필수 필드를 고정하라
위 초안을 JSON Schema 페이지에 붙여 period, sku, gpu_hours, 단가가 남아 있는지 확인한다.
-
3
두 달을 비교하라
JSON Diff 로 sku가 H100에서 H200으로 바뀌었는지, 단가와 gpu_hours 중 어느 쪽이 올랐는지 본다.
-
4
동료가 필요할 때만 공유하라
Hash 공유 로 샘플(비밀은 넣지 말 것)을 URL fragment에 넣는다. 서버에는 가지 않는다.
자주 묻는 질문
AI가 비싸진 것은 GPU 값만 올랐기 때문인가요?
아닙니다. GPU는 가장 눈에 띄는 층일 뿐입니다. HBM, CoWoS 패키징, 전력, 액냉, 변전소 리드타임이 모두 올랐습니다. NVIDIA는 2026년 8월 메모리 비용을 이유로 일부 AI 서버를 15% 넘게 인상한다고 대고객에 알렸습니다.
HBM은 무엇이며, 왜 칩보다 더 빠듯한가요?
HBM은 GPU 옆에 쌓이는 고대역 메모리입니다. 가중치와 KV cache가 여기에 있습니다. Blackwell에서 HBM은 자재비의 약 45%–50%입니다. SK hynix, Samsung, Micron의 2026년 HBM4는 거의 완판되었고, 고객은 주문량의 약 60%–70%만 받습니다.
학습이 더 비싼가요, 추론이 더 비싼가요?
학습은 한 번의 거액 청구서이고, 추론은 매일 도착하는 청구서입니다. 업계 추정으로 AI 연산의 80%–90%는 추론입니다. test-time compute는 「한 번의 답」을 「여러 번의 순전파」로 바꿔 HBM과 GPU시간이 함께 늘어납니다.
GPU를 사는 것과 클라우드를 빌리는 것, 어느 쪽이 싼가요?
가동률에 달렸습니다. 클러스터를 장기적으로 약 60%–70% 넘게 쓰면 매입이나 예약이 유리하고, 돌발 파인튜닝·평가·실험은 시간 단위 임대가 맞습니다. 시중 GPU 가격과 하이퍼스케일러 온디맨드를 직접 비교하지 마세요. 유통 경로 차이만으로 이미 여러 배입니다.
오픈소스 모델이면 이 청구를 피할 수 있나요?
피할 수 없습니다. 오픈 웨이트가 아끼는 것은 API 마진이지 GPU, HBM, 전력이 아닙니다. 무료 다운로드 뒤에도 누군가는 실행 비용을 냅니다. 배포 입구는 오히려 더 비싸질 수 있습니다. NVIDIA의 Hugging Face 거래를 보세요.
요약
AI가 비싸지는 것은 수요가 네 가지 짧은 것—NVIDIA GPU, HBM, 첨단 패키징, 전력을 받을 수 있는 랙—위에 쌓여 있기 때문이다.
사용자는 토큰을 내고, 회사는 GPU시간과 메가와트를 낸다. HBM은 이미 서버 인상 통지에 적혀 있다.
개발자가 할 일은 컨텍스트, 추론 깊이, 클러스터 종류를 검증 가능한 JSON으로 쓰는 것이지, 다음 카드가 알아서 값을 내리길 기다리는 것이 아니다. JSONNote에서 포맷, 검증, Diff 하라. 비밀과 청구서는 올릴 필요가 없다.