Блог ИИ / Вычисления

Почему ИИ дорожает? GPU NVIDIA, HBM, дата-центры и гонка вычислительных мощностей

ИИ дорожает не потому, что окно чата вдруг стало платным, а потому что каждый «лучший» ответ сжигает больше GPU, больше HBM, больше электричества и больше стоек. К середине 2026 H100 всё ещё стоила 25 000–40 000 $; H200 и B200 выше; полная стойка GB200 NVL72 котируется в $2–3,4 млн.

NVIDIA говорит, что закрывает лишь около 70% спроса существующих клиентов. В августе 2026 она сообщила крупным покупателям, что стоимость памяти поднимет часть ИИ-серверов больше чем на 15%. Дефицит уже не «нет карт» — карты, память и электричество растут вместе.

Пользователи видят цену токена. В книгах компаний — GPU-часы, ёмкость HBM и мегаватты. Если эти две системы чисел не сходятся, спор остаётся на лозунгах.

В этой статье:

Запомните это: Пользователи платят токены. Компании платят GPU-часы, HBM и мегаватты. Дальше это разбирается как цепочка → GPU → HBM → зал → обучение/инференс → счёт разработчика.

Подорожала не модель

Разложите «ИИ дорогой» на шесть слоёв. Каждый слой продаёт своё и застревает в своём месте. Сложите их — получите счёт 2026 года.

Слой Что продаёт Узкое место 2026
Модель Веса, лицензии, оценки Открытые веса не бесплатны в запуске; дверь дистрибуции покупают производители чипов
GPU Ускорители и системы Предложение закрывает около 70% спроса; штучные цены не падают
HBM Дом весов и KV cache Около половины BOM Blackwell; HBM4 распродана до 2027
CoWoS Связать логический кристалл с HBM Сроки TSMC CoWoS больше 52 недель; мощность забронирована на 2026–2027
Дата-центр Земля, подстанции, жидкостное охлаждение, стойки Стойке GB200 нужно 120–130 kW; электричество медленнее кремния
Token / API Интерфейсы с оплатой за вызов Прайс может двигаться; GPU-часы и киловатт-часы с ним не падают

Поэтому «почему ИИ дорожает» — не продуктовый вопрос. Модели можно открыть, API — скинуть. Стеки HBM, CoWoS и расширение подстанций той же уценки не получают.

GPU NVIDIA: от одной карты к одной стойке

NVIDIA не публикует официальный прайс датацентровых GPU. Улица, OEM и облако расходятся в разы. Таблица ниже берёт рыночные диапазоны середины 2026 против публичных спецификаций NVIDIA H200 и GB200 NVL72. Это диапазоны, не счета.

Читайте таблицу как два различия: покупаете чип или стойку, и платите разовый capex или почасовую аренду?

SKU Архитектура HBM Закупка (прибл.) Облачная аренда медиана/диапазон (за GPU-час)
H100 SXM5 Hopper 80GB HBM3 / 3.35 TB/s $25,000–$40,000 ~$2.29
H200 SXM Hopper 141GB HBM3e / 4.8 TB/s $30,000–$40,000 ~$3.95
B200 SXM6 Blackwell 180–192GB HBM3e / 8 TB/s $40,000–$45,000 $3.75–$9.86
GB200 NVL72 Blackwell rack 13.4TB / 72 GPU $2M–$3.4M $10.50–$27.00
GB300 NVL72 Blackwell Ultra 288GB HBM3e / GPU $3.7M–$4M

От H100 к B200 наклейка на карту поднимается лишь на ступень. От карты к GB200 NVL72 меняется единица покупки. Вы больше не покупаете ускоритель — вы покупаете жидкоохлаждаемую систему на 120–130 kW и 1,36 тонны. Уличные оценки следующего Vera Rubin NVL72 уже около $8,8 млн за стойку.

Облачный разброс не меньше. Медиана H100 on-demand около $2,29/час (наблюдали $1,38–$11,06). Медиана H200 около $3,95 — надбавка в основном покупает 141GB HBM3e, не больше FLOPS. B200 всё ещё тесный: $3,75–$9,86. Полная стойка GB200 может выйти в $10,50–$27,00 за GPU-час.

Выручка дата-центров NVIDIA в FY2027 Q1 составила $75,2 млрд, +92% год к году. Аналитики по-прежнему ставят долю выручки ИИ-ускорителей около 75%–90%. Цены не падают как у GeForce, потому что спрос всё ещё сидит поверх предложения.

HBM: узкое место — память

Модели frontier едят больше, чем FLOPS. Веса должны поместиться в память, а KV cache на инференсе продолжает расти. Длиннее контекст, больше mixture-of-experts, больше шагов рассуждения — всё сжимает HBM. H100 несёт 80GB HBM3; H200 поднимает то же поколение до 141GB HBM3e; B200 идёт к 180–192GB. Полоса прыгает с 3,35 TB/s до 8 TB/s.

Стоимость написана в спецификации. Отраслевые оценки ставят себестоимость Blackwell примерно вдвое выше H100, HBM — около половины. Когда чип дорожает, часто сдвинулась строка памяти.

Сигнал Факт середины 2026 Рамка источника
HBM3e @ Blackwell Около 45%–50% BOM GPU Цепочка / разбор BOM
HBM4 2026 Годовой выпуск распродан; клиенты получают ~60%–70% Micron / TrendForce
Повышение цен ИИ-серверов Уведомление >15% по конфигам Vera Rubin / Grace Blackwell, действует с отгрузок начала 2027 NVIDIA / Bloomberg / CNBC
Доля закрытия заказов существующих клиентов ~70% NVIDIA Q2 FY2027

В конце августа 2026 NVIDIA на отчётном звонке назвала стоимость памяти «экстремальной» и снизила гайденс валовой маржи. Это не пиар. Продвинутые стеки в объёме могут выпускать только SK hynix, Samsung и Micron. Выход и квалификация 12-high HBM4E ещё неопределённы; Rubin Ultra даже изучают со срезом спецификации.

Производители памяти держат ценовую власть, пока предложение не догонит спрос. Разработчики не могут переждать HBM. Они могут меньше её тратить: квантование, спекулятивное декодирование, более короткий контекст по умолчанию и учёт KV cache как издержки первого класса. Официальные страницы продуктов: SK hynix HBM.

Дата-центры: электричество, охлаждение и земля медленнее чипов

Даже если HBM завтра ослабнет, зал не успеет. B200 на 1 000 W уже неудобна; запереть 72 GPU в один домен NVLink — и стойке нужно 120–130 kW жидкостного охлаждения. Дверные проёмы, нагрузка на пол, контуры охлаждения и подстанции не ускоряются от того, что вы выписали заказ.

IEA Energy and AI ожидает, что мировое потребление дата-центров примерно удвоится к 2030, а залы под ИИ растут быстрее. Epoch AI и EPRI оценивают, что обучение frontier уже превышает 100 MW и может расти в 2,2–2,9 раза в год, до 1–2 GW на прогон к 2028. Электричество труднее перевозить, чем пластины.

  1. 1
    Плотность мощности переписывает зал

    Старые стойки проектировали на 10–20 kW. Шкафы класса GB200 прыгают за 120 kW. Воздуха мало; нужны жидкостное охлаждение и более толстая электрика.

  2. 2
    Подстанции и передача медленнее

    Сроки чипов — кварталы. Высоковольтное подключение — годы. Много «заказанных GPU» стоят на складе или включаются поэтапно, потому что фидер ещё не пришёл.

  3. 3
    Площадка становится энергетической задачей

    Гиперскейлеры гоняются за ядерными PPA, газовыми пикерами и генерацией за счётчиком. Дешёвая земля без свободных мегаватт не становится ИИ-заводом.

  4. 4
    Инференс превращает всплеск в базовую нагрузку

    Обучение — импульс на несколько месяцев. Чат, поиск и агенты — круглогодичная база. В рамке IEA почти половина прироста электричества ИИ-серверов — инференс.

Поэтому «купить ещё 10 000 GPU» часто вопрос сети, а не закупки. Половина войны вычислений нарисована на карте энергосистемы.

Гонка вычислений: обучить раз, инференс каждый день

Epoch AI 2024 оценивал, что амортизированная стоимость самых тяжёлых обучений росла примерно в 2,4 раза в год с 2016. Публичные цифры класса GPT-4 ещё были десятками миллионов; тот же наклон ставит обучение frontier выше миллиарда долларов около 2027. Поворот 2026 — инференс: модели рассуждения и test-time compute превращают один ответ во много прямых проходов.

Этап Кто платит Что изменилось в 2026
Предобучение Несколько лабораторий + контракты облако/чипы Один прогон уже сотни мегаватт; появляется обучение на нескольких кампусах
Постобучение / RL Те же лаборатории, более рваный счёт Сами роллауты едят GPU; обучение и инференс размываются
Онлайн-инференс Каждый пользователь продукта 80%–90% ИИ-вычислений; длинный контекст и цепочки рассуждения едят HBM напрямую

Поэтому прайс API не падает сам, когда «следующая карта быстрее». Карта быстрее, но каждый запрос делает больше шагов и держит больше состояния в HBM. FLOP дешевеет; полезный ответ — не обязательно.

Открытый исход тоже платит. Веса могут быть бесплатными. Кластеры — нет. Кто держит дверь обнаружения по умолчанию и SKU инференса, ближе к цене — фон сделки NVIDIA на $12,9 млрд за Hugging Face.

Что это значит для разработчиков

Сейчас до 2027 меняйте, как вы используете вычисления, а не как к ним относитесь. Эти четыре шага лучше ожидания уценки.

  1. 1
    Считать контекст и глубину рассуждения ручками стоимости

    Окно 128K по умолчанию и «думать дольше» по умолчанию сразу становятся HBM и GPU-часами. Потолки на уровне продукта дешевле сюрприза в счёте.

  2. 2
    Отделить экспериментальные кластеры от производственных

    Оценки, свипы и разовые дообучения — на spot или вытесняемые мощности. Продакшен-инференс — на резерв. Смешивать их в одном on-demand счёте — самая дорогая привычка.

  3. 3
    Открытые веса экономят маржу, не электричество

    Свой хостинг всё равно значит купить или арендовать GPU. Зафиксируйте revision и license; см. сделку NVIDIA по Hugging Face, а не предполагайте, что Hub вечно хостит бесплатно.

  4. 4
    Превратить счёт в проверяемый JSON-контракт

    Облачные счета, внутренний инвентарь GPU и расход токенов в итоге — JSON. Если поля не сходятся, вы не ответите, какой слой подорожал.

Как выглядит счёт затрат в JSON

Заголовки сделок и язык отчётности книги не сведут. Работать можно с ежемесячным объектом usage из облака или внутренней платформы.

Ниже форма ежемесячного счёта, которую можно проверить локально — имена полей типичны для внутренних систем затрат; цифры — примеры, не настоящий облачный счёт.

Ежемесячный счёт инференса GPU (пример, не настоящий счёт)
{
  "period": "2026-08",
  "cluster": "inference-prod-1",
  "sku": "H200-SXM",
  "gpu_count": 64,
  "gpu_hours": 18432,
  "usd_per_gpu_hour": 3.95,
  "power_kwh": 12902,
  "usd_per_kwh": 0.08,
  "tokens_out": 4120000000,
  "currency": "USD"
}

С этим объектом вы ответите на три вопроса: GPU-часы умножить на цену, сколько стоит электричество, стоимость на выходной токен. Пропадёт sku или gpu_hours станет строкой — все отчёты дальше поплывут.

Черновик JSON Schema для объекта затрат
{
  "$schema": "https://json-schema.org/draft/2020-12/schema",
  "type": "object",
  "required": [
    "period", "sku", "gpu_hours",
    "usd_per_gpu_hour", "currency"
  ],
  "properties": {
    "period": { "type": "string", "pattern": "^[0-9]{4}-[0-9]{2}$" },
    "cluster": { "type": "string", "minLength": 1 },
    "sku": { "type": "string", "minLength": 1 },
    "gpu_count": { "type": "integer", "minimum": 1 },
    "gpu_hours": { "type": "number", "minimum": 0 },
    "usd_per_gpu_hour": { "type": "number", "minimum": 0 },
    "power_kwh": { "type": "number", "minimum": 0 },
    "usd_per_kwh": { "type": "number", "minimum": 0 },
    "tokens_out": { "type": "integer", "minimum": 0 },
    "currency": { "type": "string", "enum": ["USD"] }
  },
  "additionalProperties": false
}

Та же привычка для полей usage модельных API: prompt_tokens, completion_tokens, reasoning_tokens. Сначала проверить форму, потом оптимизировать.

Сверить счёт в JSONNote

Медленная часть редко в формуле. Она в том, чтобы увидеть, какая строка двух JSON расходится. JSONNote работает локально в браузере:

  1. 1
    Сначала отформатировать счёт

    Вставьте облачный экспорт или внутренний объект usage в формат JSON, чтобы убрать шум синтаксиса и отступов.

  2. 2
    Закрепить обязательные поля схемой

    Вставьте черновик на страницу JSON Schema и убедитесь, что period, sku, gpu_hours и цена ещё на месте.

  3. 3
    Сравнить два месяца

    Через JSON Diff посмотрите, ушёл ли sku с H100 на H200 и что выросло — цена или gpu_hours.

  4. 4
    Делиться только когда коллеге нужно

    Через Hash-шаринг положите образец (никогда секреты) в URL fragment. На сервер ничего не уходит.

Частые вопросы

ИИ дорожает только потому, что подорожали GPU?

Нет. GPU — лишь видимый слой. HBM, упаковка CoWoS, электричество, жидкостное охлаждение и сроки подстанций тоже выросли. В августе 2026 NVIDIA сообщила крупным клиентам, что часть ИИ-серверов подорожает больше чем на 15%, ссылаясь на стоимость памяти.

Что такое HBM и почему она теснее чипа?

HBM — это сложенная высокоскоростная память рядом с GPU. Там живут веса и KV cache. На Blackwell HBM — около 45%–50% спецификации. Выпуск HBM4 2026 у SK hynix, Samsung и Micron в основном распродан; клиенты получают около 60%–70% заказанного объёма.

Что дороже — обучение или инференс?

Обучение — разовый девятизначный счёт. Инференс — счёт, который приходит каждый день. Отраслевые оценки относят 80%–90% ИИ-вычислений на инференс. Test-time compute превращает один ответ во много прямых проходов, поэтому HBM и GPU-часы растут вместе.

Дешевле купить GPU или арендовать облако?

Зависит от загрузки. Устойчивая загрузка кластера выше примерно 60%–70% обычно выгоднее покупки или резерва; разовые дообучения, оценки и эксперименты — почасовой аренде. Не сравнивайте уличную цену карты с on-demand гиперскейлера: разрыв каналов уже в несколько раз.

Могут ли открытые модели обойти этот счёт?

Нет. Открытые веса экономят маржу API, а не GPU, HBM и электричество. После бесплатной загрузки кто-то всё равно платит за запуск. Дверь дистрибуции может даже подорожать — см. сделку NVIDIA с Hugging Face.

Итог

ИИ дорожает, потому что спрос сложен на четырёх коротких вещах: GPU NVIDIA, HBM, продвинутая упаковка и стойки, которые реально принимают электричество.

Пользователи платят токены. Компании платят GPU-часы и мегаватты. HBM уже вписана в уведомления о повышении цен серверов.

Что могут разработчики — записать контекст, глубину рассуждения и тип кластера проверяемым JSON, а не ждать, что следующая карта сама срежет счёт. Форматируйте, проверяйте и делайте diff локально в JSONNote. Секреты и счета не нужно загружать.

← Назад к блогу