Блог • ИИ / Вычисления
Почему ИИ дорожает? GPU NVIDIA, HBM, дата-центры и гонка вычислительных мощностей
ИИ дорожает не потому, что окно чата вдруг стало платным, а потому что каждый «лучший» ответ сжигает больше GPU, больше HBM, больше электричества и больше стоек. К середине 2026 H100 всё ещё стоила 25 000–40 000 $; H200 и B200 выше; полная стойка GB200 NVL72 котируется в $2–3,4 млн.
NVIDIA говорит, что закрывает лишь около 70% спроса существующих клиентов. В августе 2026 она сообщила крупным покупателям, что стоимость памяти поднимет часть ИИ-серверов больше чем на 15%. Дефицит уже не «нет карт» — карты, память и электричество растут вместе.
Пользователи видят цену токена. В книгах компаний — GPU-часы, ёмкость HBM и мегаватты. Если эти две системы чисел не сходятся, спор остаётся на лозунгах.
В этой статье:
- Дорогая не модель, а вся цепочка поставок вычислений
- Лестница цен NVIDIA от H100 до GB300
- Почему HBM стала настоящим узким местом
- Почему электричество, охлаждение и площадки дата-центров медленнее чипов
- Обучение — всплеск, инференс — каждый день, и как читать счёт как JSON
Запомните это: Пользователи платят токены. Компании платят GPU-часы, HBM и мегаватты. Дальше это разбирается как цепочка → GPU → HBM → зал → обучение/инференс → счёт разработчика.
Подорожала не модель
Разложите «ИИ дорогой» на шесть слоёв. Каждый слой продаёт своё и застревает в своём месте. Сложите их — получите счёт 2026 года.
| Слой | Что продаёт | Узкое место 2026 |
|---|---|---|
| Модель | Веса, лицензии, оценки | Открытые веса не бесплатны в запуске; дверь дистрибуции покупают производители чипов |
| GPU | Ускорители и системы | Предложение закрывает около 70% спроса; штучные цены не падают |
| HBM | Дом весов и KV cache | Около половины BOM Blackwell; HBM4 распродана до 2027 |
| CoWoS | Связать логический кристалл с HBM | Сроки TSMC CoWoS больше 52 недель; мощность забронирована на 2026–2027 |
| Дата-центр | Земля, подстанции, жидкостное охлаждение, стойки | Стойке GB200 нужно 120–130 kW; электричество медленнее кремния |
| Token / API | Интерфейсы с оплатой за вызов | Прайс может двигаться; GPU-часы и киловатт-часы с ним не падают |
Поэтому «почему ИИ дорожает» — не продуктовый вопрос. Модели можно открыть, API — скинуть. Стеки HBM, CoWoS и расширение подстанций той же уценки не получают.
GPU NVIDIA: от одной карты к одной стойке
NVIDIA не публикует официальный прайс датацентровых GPU. Улица, OEM и облако расходятся в разы. Таблица ниже берёт рыночные диапазоны середины 2026 против публичных спецификаций NVIDIA H200 и GB200 NVL72. Это диапазоны, не счета.
Читайте таблицу как два различия: покупаете чип или стойку, и платите разовый capex или почасовую аренду?
| SKU | Архитектура | HBM | Закупка (прибл.) | Облачная аренда медиана/диапазон (за GPU-час) |
|---|---|---|---|---|
| H100 SXM5 | Hopper | 80GB HBM3 / 3.35 TB/s | $25,000–$40,000 | ~$2.29 |
| H200 SXM | Hopper | 141GB HBM3e / 4.8 TB/s | $30,000–$40,000 | ~$3.95 |
| B200 SXM6 | Blackwell | 180–192GB HBM3e / 8 TB/s | $40,000–$45,000 | $3.75–$9.86 |
| GB200 NVL72 | Blackwell rack | 13.4TB / 72 GPU | $2M–$3.4M | $10.50–$27.00 |
| GB300 NVL72 | Blackwell Ultra | 288GB HBM3e / GPU | $3.7M–$4M | — |
От H100 к B200 наклейка на карту поднимается лишь на ступень. От карты к GB200 NVL72 меняется единица покупки. Вы больше не покупаете ускоритель — вы покупаете жидкоохлаждаемую систему на 120–130 kW и 1,36 тонны. Уличные оценки следующего Vera Rubin NVL72 уже около $8,8 млн за стойку.
Облачный разброс не меньше. Медиана H100 on-demand около $2,29/час (наблюдали $1,38–$11,06). Медиана H200 около $3,95 — надбавка в основном покупает 141GB HBM3e, не больше FLOPS. B200 всё ещё тесный: $3,75–$9,86. Полная стойка GB200 может выйти в $10,50–$27,00 за GPU-час.
Выручка дата-центров NVIDIA в FY2027 Q1 составила $75,2 млрд, +92% год к году. Аналитики по-прежнему ставят долю выручки ИИ-ускорителей около 75%–90%. Цены не падают как у GeForce, потому что спрос всё ещё сидит поверх предложения.
HBM: узкое место — память
Модели frontier едят больше, чем FLOPS. Веса должны поместиться в память, а KV cache на инференсе продолжает расти. Длиннее контекст, больше mixture-of-experts, больше шагов рассуждения — всё сжимает HBM. H100 несёт 80GB HBM3; H200 поднимает то же поколение до 141GB HBM3e; B200 идёт к 180–192GB. Полоса прыгает с 3,35 TB/s до 8 TB/s.
Стоимость написана в спецификации. Отраслевые оценки ставят себестоимость Blackwell примерно вдвое выше H100, HBM — около половины. Когда чип дорожает, часто сдвинулась строка памяти.
| Сигнал | Факт середины 2026 | Рамка источника |
|---|---|---|
| HBM3e @ Blackwell | Около 45%–50% BOM GPU | Цепочка / разбор BOM |
| HBM4 2026 | Годовой выпуск распродан; клиенты получают ~60%–70% | Micron / TrendForce |
| Повышение цен ИИ-серверов | Уведомление >15% по конфигам Vera Rubin / Grace Blackwell, действует с отгрузок начала 2027 | NVIDIA / Bloomberg / CNBC |
| Доля закрытия заказов существующих клиентов | ~70% | NVIDIA Q2 FY2027 |
В конце августа 2026 NVIDIA на отчётном звонке назвала стоимость памяти «экстремальной» и снизила гайденс валовой маржи. Это не пиар. Продвинутые стеки в объёме могут выпускать только SK hynix, Samsung и Micron. Выход и квалификация 12-high HBM4E ещё неопределённы; Rubin Ultra даже изучают со срезом спецификации.
Производители памяти держат ценовую власть, пока предложение не догонит спрос. Разработчики не могут переждать HBM. Они могут меньше её тратить: квантование, спекулятивное декодирование, более короткий контекст по умолчанию и учёт KV cache как издержки первого класса. Официальные страницы продуктов: SK hynix HBM.
Дата-центры: электричество, охлаждение и земля медленнее чипов
Даже если HBM завтра ослабнет, зал не успеет. B200 на 1 000 W уже неудобна; запереть 72 GPU в один домен NVLink — и стойке нужно 120–130 kW жидкостного охлаждения. Дверные проёмы, нагрузка на пол, контуры охлаждения и подстанции не ускоряются от того, что вы выписали заказ.
IEA Energy and AI ожидает, что мировое потребление дата-центров примерно удвоится к 2030, а залы под ИИ растут быстрее. Epoch AI и EPRI оценивают, что обучение frontier уже превышает 100 MW и может расти в 2,2–2,9 раза в год, до 1–2 GW на прогон к 2028. Электричество труднее перевозить, чем пластины.
-
1
Плотность мощности переписывает зал
Старые стойки проектировали на 10–20 kW. Шкафы класса GB200 прыгают за 120 kW. Воздуха мало; нужны жидкостное охлаждение и более толстая электрика.
-
2
Подстанции и передача медленнее
Сроки чипов — кварталы. Высоковольтное подключение — годы. Много «заказанных GPU» стоят на складе или включаются поэтапно, потому что фидер ещё не пришёл.
-
3
Площадка становится энергетической задачей
Гиперскейлеры гоняются за ядерными PPA, газовыми пикерами и генерацией за счётчиком. Дешёвая земля без свободных мегаватт не становится ИИ-заводом.
-
4
Инференс превращает всплеск в базовую нагрузку
Обучение — импульс на несколько месяцев. Чат, поиск и агенты — круглогодичная база. В рамке IEA почти половина прироста электричества ИИ-серверов — инференс.
Поэтому «купить ещё 10 000 GPU» часто вопрос сети, а не закупки. Половина войны вычислений нарисована на карте энергосистемы.
Гонка вычислений: обучить раз, инференс каждый день
Epoch AI 2024 оценивал, что амортизированная стоимость самых тяжёлых обучений росла примерно в 2,4 раза в год с 2016. Публичные цифры класса GPT-4 ещё были десятками миллионов; тот же наклон ставит обучение frontier выше миллиарда долларов около 2027. Поворот 2026 — инференс: модели рассуждения и test-time compute превращают один ответ во много прямых проходов.
| Этап | Кто платит | Что изменилось в 2026 |
|---|---|---|
| Предобучение | Несколько лабораторий + контракты облако/чипы | Один прогон уже сотни мегаватт; появляется обучение на нескольких кампусах |
| Постобучение / RL | Те же лаборатории, более рваный счёт | Сами роллауты едят GPU; обучение и инференс размываются |
| Онлайн-инференс | Каждый пользователь продукта | 80%–90% ИИ-вычислений; длинный контекст и цепочки рассуждения едят HBM напрямую |
Поэтому прайс API не падает сам, когда «следующая карта быстрее». Карта быстрее, но каждый запрос делает больше шагов и держит больше состояния в HBM. FLOP дешевеет; полезный ответ — не обязательно.
Открытый исход тоже платит. Веса могут быть бесплатными. Кластеры — нет. Кто держит дверь обнаружения по умолчанию и SKU инференса, ближе к цене — фон сделки NVIDIA на $12,9 млрд за Hugging Face.
Что это значит для разработчиков
Сейчас до 2027 меняйте, как вы используете вычисления, а не как к ним относитесь. Эти четыре шага лучше ожидания уценки.
-
1
Считать контекст и глубину рассуждения ручками стоимости
Окно 128K по умолчанию и «думать дольше» по умолчанию сразу становятся HBM и GPU-часами. Потолки на уровне продукта дешевле сюрприза в счёте.
-
2
Отделить экспериментальные кластеры от производственных
Оценки, свипы и разовые дообучения — на spot или вытесняемые мощности. Продакшен-инференс — на резерв. Смешивать их в одном on-demand счёте — самая дорогая привычка.
-
3
Открытые веса экономят маржу, не электричество
Свой хостинг всё равно значит купить или арендовать GPU. Зафиксируйте revision и license; см. сделку NVIDIA по Hugging Face, а не предполагайте, что Hub вечно хостит бесплатно.
-
4
Превратить счёт в проверяемый JSON-контракт
Облачные счета, внутренний инвентарь GPU и расход токенов в итоге — JSON. Если поля не сходятся, вы не ответите, какой слой подорожал.
Как выглядит счёт затрат в JSON
Заголовки сделок и язык отчётности книги не сведут. Работать можно с ежемесячным объектом usage из облака или внутренней платформы.
Ниже форма ежемесячного счёта, которую можно проверить локально — имена полей типичны для внутренних систем затрат; цифры — примеры, не настоящий облачный счёт.
{
"period": "2026-08",
"cluster": "inference-prod-1",
"sku": "H200-SXM",
"gpu_count": 64,
"gpu_hours": 18432,
"usd_per_gpu_hour": 3.95,
"power_kwh": 12902,
"usd_per_kwh": 0.08,
"tokens_out": 4120000000,
"currency": "USD"
}
С этим объектом вы ответите на три вопроса: GPU-часы умножить на цену, сколько стоит электричество, стоимость на выходной токен. Пропадёт sku или gpu_hours станет строкой — все отчёты дальше поплывут.
{
"$schema": "https://json-schema.org/draft/2020-12/schema",
"type": "object",
"required": [
"period", "sku", "gpu_hours",
"usd_per_gpu_hour", "currency"
],
"properties": {
"period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
"cluster": { "type": "string", "minLength": 1 },
"sku": { "type": "string", "minLength": 1 },
"gpu_count": { "type": "integer", "minimum": 1 },
"gpu_hours": { "type": "number", "minimum": 0 },
"usd_per_gpu_hour": { "type": "number", "minimum": 0 },
"power_kwh": { "type": "number", "minimum": 0 },
"usd_per_kwh": { "type": "number", "minimum": 0 },
"tokens_out": { "type": "integer", "minimum": 0 },
"currency": { "type": "string", "enum": ["USD"] }
},
"additionalProperties": false
}
Та же привычка для полей usage модельных API: prompt_tokens, completion_tokens, reasoning_tokens. Сначала проверить форму, потом оптимизировать.
Сверить счёт в JSONNote
Медленная часть редко в формуле. Она в том, чтобы увидеть, какая строка двух JSON расходится. JSONNote работает локально в браузере:
-
1
Сначала отформатировать счёт
Вставьте облачный экспорт или внутренний объект usage в формат JSON, чтобы убрать шум синтаксиса и отступов.
-
2
Закрепить обязательные поля схемой
Вставьте черновик на страницу JSON Schema и убедитесь, что period, sku, gpu_hours и цена ещё на месте.
-
3
Сравнить два месяца
Через JSON Diff посмотрите, ушёл ли sku с H100 на H200 и что выросло — цена или gpu_hours.
-
4
Делиться только когда коллеге нужно
Через Hash-шаринг положите образец (никогда секреты) в URL fragment. На сервер ничего не уходит.
Частые вопросы
ИИ дорожает только потому, что подорожали GPU?
Нет. GPU — лишь видимый слой. HBM, упаковка CoWoS, электричество, жидкостное охлаждение и сроки подстанций тоже выросли. В августе 2026 NVIDIA сообщила крупным клиентам, что часть ИИ-серверов подорожает больше чем на 15%, ссылаясь на стоимость памяти.
Что такое HBM и почему она теснее чипа?
HBM — это сложенная высокоскоростная память рядом с GPU. Там живут веса и KV cache. На Blackwell HBM — около 45%–50% спецификации. Выпуск HBM4 2026 у SK hynix, Samsung и Micron в основном распродан; клиенты получают около 60%–70% заказанного объёма.
Что дороже — обучение или инференс?
Обучение — разовый девятизначный счёт. Инференс — счёт, который приходит каждый день. Отраслевые оценки относят 80%–90% ИИ-вычислений на инференс. Test-time compute превращает один ответ во много прямых проходов, поэтому HBM и GPU-часы растут вместе.
Дешевле купить GPU или арендовать облако?
Зависит от загрузки. Устойчивая загрузка кластера выше примерно 60%–70% обычно выгоднее покупки или резерва; разовые дообучения, оценки и эксперименты — почасовой аренде. Не сравнивайте уличную цену карты с on-demand гиперскейлера: разрыв каналов уже в несколько раз.
Могут ли открытые модели обойти этот счёт?
Нет. Открытые веса экономят маржу API, а не GPU, HBM и электричество. После бесплатной загрузки кто-то всё равно платит за запуск. Дверь дистрибуции может даже подорожать — см. сделку NVIDIA с Hugging Face.
Итог
ИИ дорожает, потому что спрос сложен на четырёх коротких вещах: GPU NVIDIA, HBM, продвинутая упаковка и стойки, которые реально принимают электричество.
Пользователи платят токены. Компании платят GPU-часы и мегаватты. HBM уже вписана в уведомления о повышении цен серверов.
Что могут разработчики — записать контекст, глубину рассуждения и тип кластера проверяемым JSON, а не ждать, что следующая карта сама срежет счёт. Форматируйте, проверяйте и делайте diff локально в JSONNote. Секреты и счета не нужно загружать.