NVIDIA выпустила RTX 5090 в начале 2025 года, и к середине 2026-го карта дошла до российских облаков. У арендатора появился выбор внутри одного класса: взять проверенную 4090 или доплатить за свежую Blackwell. Вопрос звучит просто, но ответ целиком зависит от того, чем именно вы грузите карту.

Дальше — по порядку. Где превосходство 5090 переходит в реальную скорость вашей задачи, где оно остаётся строчкой в спецификации, и как выбрать под свой сценарий без переплаты. Сравнивать будем на инженерных характеристиках, а не на игровых бенчмарках: аудитория здесь другая.

Зачем брать consumer-карту в облаке

H100 на 80 ГБ создавалась под модели на 70 миллиардов параметров и серьёзный foundation-тренинг. Для большей части задач инди-разработчика или небольшой команды это избыток, за который платишь впустую. RTX 4090 и 5090 закрывают ровно тот диапазон, где мощности достаточно, а цена ниже в разы:

  • инференс и дообучение LLM до 30B (через LoRA / QLoRA);
  • vision-модели — Stable Diffusion XL, Flux, ControlNet;
  • ML-эксперименты на коротких сессиях;
  • прототип LLM-фичи до решения «масштабироваться или нет».

У этого диапазона есть жёсткий потолок, и про него стоит помнить с самого начала. 24 ГБ у 4090 и 32 ГБ у 5090 — это вся память, что у вас есть. Llama 3 70B не поместится сюда даже в QLoRA. Если ваш workload упирается в такой объём, ниже есть раздел про датацентр-карты, а consumer остаётся про small-to-medium scale.

Что показывает спецификация

Прежде чем спорить о скорости, посмотрим на голые числа. Они верифицируются по данным NVIDIA и задают рамку для всего дальнейшего.

ХарактеристикаRTX 4090RTX 5090
АрхитектураAda Lovelace (AD102)Blackwell (GB202)
VRAM24 ГБ GDDR6X32 ГБ GDDR7 (+33%)
Пропускная способность памяти~1 ТБ/с (1008 ГБ/с, шина 384 бит)1792 ГБ/с (шина 512 бит), +78%
CUDA-ядра16 38421 760 (+33%)
Тензорные ядра512 (4-е поколение)680 (5-е поколение, native FP4)
L2-кэш73 МБ98 МБ
Потолок точности TensorFP8FP4
TGP450 Вт575 Вт

Из таблицы решают не все строки, а две. Первая — пропускная способность памяти: у 5090 она выше на 78%. Именно она, а не число ядер, задаёт разницу там, где карта читает веса модели быстрее, чем их обсчитывает. Вторая — FP4: пятое поколение тензорных ядер Blackwell считает в четырёхбитной точности нативно, тогда как у 4090 потолок FP8. Для моделей, которые корректно квантуются в FP4, это отдельный рычаг ускорения поверх памяти.

Остальное — контекст. Больше ядер, больше кэша, выше энергопотребление: всё работает на итог, но не оно решает, стоит ли доплата.

Где доплата за 5090 окупается

Разница между картами не абстрактная — она проявляется в конкретных режимах. Разложим их по тому, упирается задача в память или в вычисления.

Инференс LLM на 13–30B

Это главный аргумент за 5090. На моделях такого размера карта упирается не в вычисления, а в скорость чтения весов из памяти, а тут у Blackwell преимущество в 78%. Прирост пропускной способности конвертируется в throughput почти линейно: ускорение заметное, а не косметическое.

Точные tokens/sec назвать честно нельзя. Они зависят от модели, кванта и рантайма — vLLM, llama.cpp и TensorRT-LLM дают разные цифры на одном железе. Если для вас это критично, прогоните свою связку на почасовой аренде обеих карт и померьте на своих весах; свежие сравнения по популярным моделям несложно найти в бенчмарк-тредах Hugging Face. Направление известно заранее: на 13–30B 5090 ощутимо впереди.

Vision-инференс с высоким throughput

Генерация изображений — SDXL, Flux — на пакетном инференсе тоже упирается в память. Логика та же, что и с LLM: чем быстрее память, тем больше картинок в секунду с одной карты. Для продукта с пиковыми нагрузками на генерацию 5090 отдаёт заметно больше запросов на тот же GPU.

Дообучение 7–13B через LoRA

Здесь режим ближе к compute-bound, и преимущество 5090 держится, но по другой причине — за счёт ядер, а не памяти. На большом числе прогонов экономия времени на эпоху складывается в реальные часы. Гоняете много экспериментов — почувствуете.

Модели с поддержкой FP4

Свежие модели — Llama 3.1, Mistral Nemo и другие — квантуются в FP4 без серьёзной потери качества. На таких весах включается нативный FP4 у 5090, которого на 4090 попросту нет. Для production-инференса под нагрузкой, где FP4-деградация приемлема, выбор в пользу 5090 однозначен.

Где разницу платить не за что

Столько же сценариев, где 5090 почти не отрывается от 4090, и переплата не окупается.

Небольшие модели до 7B

Phi-3 mini, Qwen2 7B, Llama 3 8B на 4090 уже идут близко к потолку по токенам в секунду. 5090 быстрее, но прибавка невелика, а цена выше заметно. Для этого класса 4090 — рациональный выбор.

Пакетная обработка без требований к латентности

Если задача — прогнать за ночь миллион документов, а не ответить пользователю за секунду, разница между картами размывается. На таких batch-джобах отношение throughput к цене нередко лучше у 4090.

Инференс на тяжёлом кванте

На сильно квантованных весах (llama.cpp Q4_K_M и подобное) узким местом становятся вычисления, а не память. Преимущество 5090 по bandwidth здесь работает вполсилы, и 4090 держится почти вровень.

Vision с batch=1

ControlNet, IP-Adapter, генерация одной картинки — пропускная способность памяти тут не бутылочное горлышко. 5090 быстрее, но не настолько, чтобы это меняло выбор.

Цены в РФ-облаках

Карты есть у шести провайдеров на 4090 и у пяти на 5090 — всего в каталоге РФ 11 провайдеров с GPU. Ниже — минимальный по цене одиночный вариант каждой карты у каждого. Конфигурация хоста (vCPU / RAM / диск) у всех разная, поэтому колонку цены нельзя читать в лоб — смотрите её рядом с обвязкой.

RTX 4090 (24 ГБ)

ПровайдерКонфиг (vCPU/RAM/диск)Локация₽/мес₽/часПодробнее
AdminVPS8 / 64 / 240Исландия28 669
IQHost8 / 16 / 120Москва29 24055,00
immers.cloud8 / 16 / 40Москва44 69082,76
Cloud4Y16 / 64 / 500Москва72 061
GPUDC8 / 128 / 400Москва— (почасовая)100,00

Отдельно стоит FirstVDS: под именем «RTX 4090» там модифицированная карта на 48 ГБ («4090 Turbo»), а не референсная 24-гигабайтная. Её 61 500 ₽/мес — цена за другую железку, в один ряд с обычной 4090 её ставить нельзя.

RTX 5090 (32 ГБ)

ПровайдерКонфиг (vCPU/RAM/диск)Локация₽/мес₽/часПодробнее
IQHost4 / 8 / 120Москва38 25072,08
FirstVDS4 / 16 / 250Москва53 465
immers.cloud8 / 32 / 60Москва70 610130,76
Cloud4Y16 / 64 / 500Москва108 449
GPUDC16 / 256 / 400Москва— (почасовая)150,00

Цены — на дату статьи; у immers месячная со скидкой за предоплату 30 дней. Кроме одиночных карт, immers собирает конфигурации до 8× на обе модели — верхняя граница уходит за полмиллиона рублей в месяц, но это уже про multi-GPU, а не про выбор одной карты.

Что видно из цен

Дешевле всего 4090 берётся за рубежом: каталожный минимум держит AdminVPS в Исландии (28 669 ₽), но в России этой карты у него нет совсем. Самый дешёвый российский вариант — IQHost за 29 240 ₽. А 5090 в каталоге стоит только в Москве, ни одного зарубежного тарифа с ней нет.

Дальше — главное про «переплату за 5090». Сравнивать минимумы в лоб (38 250 против 28 669) бессмысленно: это московский IQHost против исландского AdminVPS. Честный ответ виден там, где у одного провайдера хост одинаковый, а меняется только карта. У immers таких пар восемь подряд, и надбавка на всех одна и та же — плюс 24 300 ₽/мес (или плюс 45 ₽/час):

Конфиг (immers)4090 ₽/мес5090 ₽/месНадбавка
8 / 32 / 16046 84071 140+24 300
16 / 64 / 16052 25676 556+24 300
32 / 128 / 16063 09487 394+24 300

Проценты, которыми обычно меряют такую разницу, здесь только сбивают: они гуляют от 39 до 52 исключительно потому, что дорожает хост, а не карта. Правильная формулировка — не «5090 дороже на столько-то процентов», а «5090 стоит фиксированные +24 300 ₽/мес к той же машине с 4090». У Cloud4Y единственная пара с идентичным хостом даёт +50%.

Наконец, почасовую оплату дают трое из шести — immers, IQHost и GPUDC. Для коротких экспериментов это меняет экономику; отдельный разбор часовых тарифов — в статье «Почасовая аренда GPU».

Decision tree: что брать под вашу задачу

1. Модель и режим.

  • LLM до 7B, инференс → 4090 (прибавка 5090 не оправдывает цену);
  • LLM 13–30B, инференс → 5090 (bandwidth +78% даёт линейный прирост throughput);
  • дообучение 7–13B (LoRA / QLoRA) → 5090 (экономия времени на эпоху);
  • LLM от 30B → не consumer-карта, нужен L40S 48 ГБ или A100/H100 (см. раздел ниже);
  • SDXL / Flux с высоким throughput → 5090;
  • ControlNet, одиночная картинка → 4090;
  • эксперименты на коротких сессиях → 4090 почасовая;
  • модели с FP4 в проде → 5090 (нативный FP4).

2. Режим нагрузки.

  • production-инференс 24/7 → месячный тариф любой из карт;
  • короткие эксперименты → почасовая аренда (кто её даёт — в таблице выше);
  • batch с мягкой латентностью → 4090 (лучше throughput на рубль);
  • латентность-критичный инференс → 5090.

3. Бюджет. Российский минимум по 4090 — около 29 000 ₽/мес (IQHost), по 5090 — от 38 000 ₽/мес (IQHost, но там слабый хост на 4 vCPU). На одинаковой машине 5090 стоит фиксированные +24 300 ₽/мес к 4090. Если закладываете до ~30 000 — это 4090; под 5090 с полноценным хостом планка начинается около 70 000.

4. Локация. RTX 5090 в каталоге есть только в Москве. 4090 тоже в основном московская, но у AdminVPS она стоит за рубежом — Исландия, Нидерланды, Германия, США, — и там же её каталожный минимум. Если требований к data residency нет, Москвы хватает почти всем.

Когда нужна не consumer-карта, а L40S или A100

Есть кейсы, где доплата за датацентр-класс окупается.

Нагрузка 24/7 годами. Consumer-карты рассчитаны на игровой режим — пиковая нагрузка часами с перерывами. В режиме постоянного аптайма они изнашиваются быстрее датацентр-аналогов, и SLA провайдера на них обычно скромнее. L40S на 48 ГБ — та же архитектура Ada, что у 4090, но датацентр-класс: память с ECC, сертификация под круглосуточную работу, заметно больший ресурс.

Multi-GPU с быстрым обменом. Ни 4090, ни 5090, ни L40S не имеют NVLink — они соединяются только через PCIe, и для распределённого обучения обмен градиентами становится узким местом. NVLink есть у A100 и H100 (сотни ГБ/с против десятков у PCIe). Если вашему workload нужно несколько карт в одной связке, consumer и L40S не подходят, смотрите в сторону A100/H100.

Объём VRAM от 48 ГБ. 32 ГБ у 5090 — потолок consumer. Если модель не помещается (Llama 3.3 70B даже в QLoRA просит около 46 ГБ), нужен L40S на 48 ГБ либо A100 на 40/80 ГБ.

Что мы советуем

Для большинства команд, работающих с LLM до 30B и vision-моделями, выбор сводится к нескольким вариантам.

По умолчанию под ограниченный бюджет берут RTX 4090 на месяц: она закрывает большую часть продуктовой разработки. Доплата за RTX 5090 на месяц оправдана, когда узкое место в пропускной способности памяти: инференс 13–30B с высоким throughput, пакетная генерация SDXL, много параллельных запросов. Под эксперименты и POC, где карта нужна на часы, дешевле почасовая 4090. А если хочется запас по памяти и надёжность под круглосуточную работу без multi-GPU, разумный промежуток между consumer и H100 — L40S на 48 ГБ с ECC.

Где сравнить все GPU-тарифы

В каталоге VPScan собраны GPU-тарифы РФ-провайдеров с фильтрами по модели (4090, 5090, A100, H100 и другие), объёму VRAM, цене и локации. Цены в таблице — на дату этой статьи; российский GPU-рынок подвижный, состав меняется, поэтому перед арендой сверьте свежие цифры в каталоге — мы пересобираем его каждый день.

Это часть серии про GPU-облако в РФ: