Ещё в 2024 году H100 в российских облаках держали два-три крупных хостера, и цена отпугивала. К середине 2026-го картина изменилась: карта Hopper есть у нескольких провайдеров, а рядом с ней в каталогах появились H100 NVL, H200 и подешевевшая A100. Выбор перестал быть «где вообще найти» и стал «какую из линейки взять и у кого».

Дальше разберём именно это. Что такое H100 и какие нагрузки она тянет, чем H100 NVL и H200 отличаются от базовой карты, где всё это доступно в РФ и по каким ценам, и когда почасовая аренда выгоднее месячной. Ориентир — команды, которые поднимают LLM в продакшене или дообучают модели под свой домен.

Зачем H100, а не RTX 4090 или 5090

Первый вопрос обычно звучит так: зачем платить за H100, если consumer-карта дешевле в разы и тоже умеет в дообучение Llama. Ответ короткий — это разные классы железа под разные нагрузки, и упираются они в разное.

H100 относится к датацентр-архитектуре Hopper, и от 4090 её отделяют не проценты, а порядки в тех местах, где это важно. Памяти у неё 80 ГБ HBM3 против 24 ГБ у 4090 — модель на 70 миллиардов параметров в consumer-карту просто не влезает, а в H100 помещается с запасом под batch и kv-кэш. Пропускная способность памяти — 3,35 ТБ/с против примерно 1 ТБ/с, и на инференсе, который упирается в чтение весов, эта разница переходит в throughput почти напрямую. Между картами в одном узле работает NVLink на 900 ГБ/с, тогда как consumer-карты общаются только через PCIe — для распределённого обучения это граница между «работает» и «не работает». Наконец, у Hopper есть FP8 и Transformer Engine, которых у Ada (4090/5090) в таком виде нет, плюс ECC-память и расчёт на круглосуточную нагрузку годами.

Отсюда простое правило. Если задача — инференс или обучение foundation-моделей от 70B, выбор однозначно H100. Если модель до 13B или это экспериментальная разработка, consumer-карта справится и сэкономит в разы; детальный разбор 4090 против 5090 — в отдельной статье серии.

H100, H100 NVL, H200 и A100 — что есть в наличии

Под общим словом «H100» в каталогах прячутся несколько разных карт, и для аренды разница существенная. Сведём их в одну таблицу — числа сверены по данным NVIDIA.

КартаАрхитектураVRAMПропускная способностьNVLinkFP8
H100 80GB (SXM5)Hopper80 ГБ HBM33,35 ТБ/с900 ГБ/сда (Transformer Engine)
H100 NVLHopper94 ГБ HBM3 на GPU~3,9 ТБ/смостом, парамида
H200Hopper141 ГБ HBM3e4,8 ТБ/с900 ГБ/сда
A100 80GB (SXM4)Ampere80 ГБ HBM2e2,04 ТБ/с600 ГБ/снет

H100 80GB — та самая «классическая» карта, стандарт под модели уровня 70B. Именно её держит большинство провайдеров.

H100 NVL — вариант под инференс больших LLM: 94 ГБ памяти на GPU против 80 у базовой карты, чуть выше пропускная способность, а поставляется парой карт, соединённых NVLink. Когда нужен low-latency инференс Llama 70B без шардирования между узлами, это разумный выбор.

H200 использует тот же вычислительный кристалл, что и H100, — по compute они идентичны. Отличие целиком в памяти: 141 ГБ HBM3e и 4,8 ТБ/с против 80 ГБ и 3,35 ТБ/с. То есть плюс 76% объёма и плюс 43% скорости при неизменных ядрах. Для моделей с длинным контекстом или инференса от 70B с высоким throughput это прямой выигрыш; на задачах, которые и так помещаются в 80 ГБ, разницы почти нет, и переплата не оправдана.

A100 80GB — прошлое поколение, Ampere. Пропускная способность памяти в 1,6 раза ниже, чем у H100, а нативного FP8 нет вовсе. Зато карта дешевле и встречается у большего числа провайдеров, что делает её рабочим вариантом там, где latency не критична.

Когда какая карта

Разложим по типу нагрузки, без привязки к синтетическим бенчмаркам.

  • инференс LLM 70B → H100 80GB, комфортный стандарт;
  • инференс 70B+ с высоким throughput или длинным контекстом → H200, за счёт памяти;
  • low-latency инференс 70B в одном инстансе → H100 NVL;
  • обучение foundation-моделей с нуля → кластер 8× H100 SXM5 на NVLink (single-GPU здесь экономически невозможен, и у тех, кто это делает, обычно своя инфраструктура, а не аренда);
  • дообучение 13–30B (LoRA/QLoRA) → хватит A100 80GB, а то и consumer-карты;
  • бюджет важнее скорости, latency некритична → A100 80GB: дешевле, медленнее по памяти, без FP8.

Точные tokens/sec по каждой карте называть честно нельзя — они зависят от модели, кванта и рантайма. Направление же известно из спецификаций: на memory-bound инференсе выигрыш идёт вслед за пропускной способностью памяти, а на трансформерах с FP8 Hopper дополнительно отрывается от Ampere. Если цифра критична, прогоните свою связку на почасовой аренде и померьте на своих весах.

Где H100 доступна в России

H100 в каталоге сейчас есть у трёх провайдеров: immers.cloud, IQHost и Cloud4Y. При этом у immers самая полная линейка Hopper — H100, H100 NVL, H200 и A100 в одном месте, вплоть до сборок 8× на NVLink. У IQHost H100 идёт одиночными картами и дешевле по месяцу. Cloud4Y раздаёт H100 и H200 помесячно и стоит особняком по модели цены (об этом ниже). A100 к этой тройке добавляет ещё и Reg.ru: он единственный держит датацентр-карту в Санкт-Петербурге, а не в Москве.

КартаПровайдерКонфиг (vCPU/RAM/диск)₽/мес₽/часПодробнее
H100 80GBIQHost8 / 64 / 200 NVMe188 500290,83
H100 80GBimmers.cloud16 / 64 / 160 NVMe221 467341,77
H100 80GBCloud4Y44 / 64 / 240 SSD¹338 435— (помесячно)
H100 NVL 94GBimmers.cloud16 / 96 / 160 NVMe238 082367,41
H200 141GBimmers.cloud16 / 128 / 160 NVMe274 130423,04
H200 141GBCloud4Y44 / 64 / 240 SSD¹338 435— (помесячно)
A100 80GBimmers.cloud16 / 64 / 160 NVMe137 227211,77
A100 80GBReg.ru16 / 128 / 512 NVMe²162 164— (помесячно)

Цены — на дату статьи; месячная у immers указана со скидкой за предоплату 30 дней (по умолчанию активна на сайте). ¹ Cloud4Y публикует в прайсе стоимость только самой карты, без CPU и RAM; в каталоге показана минимальная разумная сборка (карта + 44 vCPU / 64 ГБ / 240 ГБ SSD), это нижняя граница чека, подробнее ниже. ² A100 у Reg.ru стоит в Санкт-Петербурге; есть и старший тариф 32 vCPU / 256 ГБ / 1024 ГБ NVMe за 199 813 ₽/мес.

Что важно про цену

Сравнивать провайдеров по одной колонке «₽/мес» здесь нельзя: за одинаковой строкой стоит разное. У Reg.ru цена идёт за весь сервер целиком, конфигурация фиксированная (16 vCPU / 128 ГБ / 512 ГБ у младшего тарифа A100). У immers и IQHost это карта с минимальной обвязкой, тариф существует ровно в таком виде. А Cloud4Y в своём прайсе публикует стоимость только самой карты, без CPU и памяти, поэтому в каталоге её месячная цифра складывается из цены карты плюс минимальная разумная сборка. Отсюда важное следствие: 338 435 ₽ у Cloud4Y это не «столько стоит H100 по прайсу», а «карта плюс минимальный хост», и цифра эта нижняя. Реальная нагрузка почти наверняка потребует больше 64 ГБ RAM, и чек вырастет. Смотреть стоит на конфигурацию рядом с ценой, а не на цену отдельно.

Второе наблюдение видно прямо из таблицы: на H100 IQHost заметно дешевле immers по месяцу (188 500 против 221 467), но и обвязка у него скромнее по vCPU. Дешевле — не всегда выгоднее на единицу полезной работы, и это стоит держать в голове.

И отдельная деталь про Cloud4Y: H200 141 ГБ там стоит ровно столько же, сколько H100 80 ГБ: обе карты идут в прайсе по одной цене. Так что если провайдер устраивает, а нужен именно объём памяти, H200 у Cloud4Y достаётся по цене H100.

Когда почасовая аренда выгоднее месячной

Почасовую оплату H100 в РФ дают немногие — из трёх провайдеров это immers и IQHost. Считается точка безубыточности просто:

1
точка_безубыточности = месячная_цена / часовая_цена

Для H100 у обоих провайдеров она выходит около 648 часов в месяц. Это не случайность: месячная у них идёт со скидкой за предоплату (у immers — 10% на датацентр-карты), и 720 часов × 0,9 как раз дают 648. Практический вывод: если карта нужна меньше чем на 27 суток в месяц, почасовая дешевле; на постоянной нагрузке 24/7 выгоднее месяц.

Экономику часовых тарифов по всей линейке GPU — с реальными цифрами и разбором, когда час выигрывает у месяца, — мы отдельно разобрали в статье «Почасовая аренда GPU».

Альтернативы, если бюджет не сходится

H100 — дорогая карта, и не под каждый проект она обязательна. Есть несколько ступеней вниз по цене без потери смысла.

Первая — A100 80GB. На инференсе 70B она медленнее H100 примерно в полтора раза по памяти и не умеет FP8, но стоит ощутимо дешевле и есть у большего числа провайдеров. Для продакшена без жёстких требований к latency — рабочий вариант.

Вторая — L40S на 48 ГБ. Это датацентр-карта архитектуры Ada с ECC, сильная именно на инференсе. Важная оговорка, которую часто путают: NVLink у L40S нет, она соединяется только через PCIe, поэтому под multi-GPU-обучение не годится. Зато как одиночная карта под инференс моделей до 70B — разумный промежуток между consumer и H100.

Третья ступень — consumer RTX 4090 и 5090. Памяти в них 24 и 32 ГБ, модель на 70B не помещается даже в QLoRA, но для дообучения до 13B и разработки они экономят кратно. Разбор этих карт — в отдельной статье серии.

Отдельно стоит держать в уме, что над Hopper уже появилась Blackwell — датацентр-ускорители B200 и B300 заходят в РФ-каталоги. Это следующий ценовой этаж и тема отдельного разбора.

Decision tree: что брать под задачу

1. Модель и режим.

  • LLM до 13B → consumer 4090/5090 или A100;
  • инференс 13–30B → A100 80GB или L40S 48GB;
  • инференс 70B → H100 80GB (или H100 NVL под low-latency в одном инстансе);
  • инференс 70B+ с высоким throughput или длинным контекстом → H200 141GB;
  • обучение 70B+ с нуля → кластер 8× H100 SXM5 на NVLink.

2. Режим нагрузки.

  • production 24/7 → месячный тариф;
  • эксперименты и POC на часы → почасовая (у immers и IQHost);
  • нерегулярные burst-нагрузки → почасовая.

3. Бюджет (ориентиры по ₽/мес, минимальные тарифы каталога):

  • до ~140 тыс — A100 80GB (от 137 227 у immers) или L40S 48GB как инференс-ступень;
  • ~190–340 тыс — H100 80GB на месяц: дешевле всего у IQHost (188 500), затем immers (221 467), у Cloud4Y дороже (338 435, где в цену зашита минимальная сборка карты);
  • ~270–340 тыс — H200 141GB (immers 274 130; у Cloud4Y 338 435, столько же, сколько её H100);
  • кластер 8× H100 на NVLink — миллионы ₽/мес, обычно по контракту, а не из каталога.

4. Локация. Hopper-карты (H100, H100 NVL, H200) у immers, IQHost и Cloud4Y стоят в Москве. A100 доступна в Москве у immers и в Санкт-Петербурге у Reg.ru. Зарубежные площадки у ряда помесячных провайдеров есть, но датацентр-карты Hopper в РФ-каталоге сосредоточены в Москве. Если требований к data residency нет, этого хватает почти всем.

Что мы советуем

Для большинства команд, поднимающих LLM в продакшене, картина сводится к нескольким вариантам.

Базовый выбор под модель уровня 70B — H100 80GB на месяц у провайдера с датацентр-SLA; из трёх на H100 стоит сравнить конфигурацию и цену хоста, а не только ставку за карту. Под эксперименты и POC, где карта нужна на часы, дешевле почасовая H100 у immers или IQHost. Доплата за H200 оправдана, когда узкое место — объём или скорость памяти: инференс от 70B с высоким throughput, длинный контекст. А если бюджет под H100 не сходится, честной ступенью вниз идут A100 80GB и L40S 48GB — с поправкой на то, что latency и FP8 у них скромнее.

Где сравнить все GPU-тарифы

В каталоге VPScan собраны GPU-тарифы провайдеров РФ с фильтрами по модели, объёму VRAM, цене и локации. Прямая ссылка на H100 — фильтр ?gpu=h100 на странице /vps/gpu. Цены в каталоге — на сегодня; российский GPU-рынок подвижный, состав и ставки меняются, поэтому перед арендой сверьте свежие цифры там — мы пересобираем каталог каждый день.

Это часть серии про GPU-облако в РФ: