NVIDIA выпустила RTX 5090 в начале 2025 года, и к середине 2026-го карта дошла до российских облаков. У арендатора появился выбор внутри одного класса: взять проверенную 4090 или доплатить за свежую Blackwell. Вопрос звучит просто, но ответ целиком зависит от того, чем именно вы грузите карту.
Дальше — по порядку. Где превосходство 5090 переходит в реальную скорость вашей задачи, где оно остаётся строчкой в спецификации, и как выбрать под свой сценарий без переплаты. Сравнивать будем на инженерных характеристиках, а не на игровых бенчмарках: аудитория здесь другая.
Зачем брать consumer-карту в облаке
H100 на 80 ГБ создавалась под модели на 70 миллиардов параметров и серьёзный foundation-тренинг. Для большей части задач инди-разработчика или небольшой команды это избыток, за который платишь впустую. RTX 4090 и 5090 закрывают ровно тот диапазон, где мощности достаточно, а цена ниже в разы:
- инференс и дообучение LLM до 30B (через LoRA / QLoRA);
- vision-модели — Stable Diffusion XL, Flux, ControlNet;
- ML-эксперименты на коротких сессиях;
- прототип LLM-фичи до решения «масштабироваться или нет».
У этого диапазона есть жёсткий потолок, и про него стоит помнить с самого начала. 24 ГБ у 4090 и 32 ГБ у 5090 — это вся память, что у вас есть. Llama 3 70B не поместится сюда даже в QLoRA. Если ваш workload упирается в такой объём, ниже есть раздел про датацентр-карты, а consumer остаётся про small-to-medium scale.
Что показывает спецификация
Прежде чем спорить о скорости, посмотрим на голые числа. Они верифицируются по данным NVIDIA и задают рамку для всего дальнейшего.
| Характеристика | RTX 4090 | RTX 5090 |
|---|---|---|
| Архитектура | Ada Lovelace (AD102) | Blackwell (GB202) |
| VRAM | 24 ГБ GDDR6X | 32 ГБ GDDR7 (+33%) |
| Пропускная способность памяти | ~1 ТБ/с (1008 ГБ/с, шина 384 бит) | 1792 ГБ/с (шина 512 бит), +78% |
| CUDA-ядра | 16 384 | 21 760 (+33%) |
| Тензорные ядра | 512 (4-е поколение) | 680 (5-е поколение, native FP4) |
| L2-кэш | 73 МБ | 98 МБ |
| Потолок точности Tensor | FP8 | FP4 |
| TGP | 450 Вт | 575 Вт |
Из таблицы решают не все строки, а две. Первая — пропускная способность памяти: у 5090 она выше на 78%. Именно она, а не число ядер, задаёт разницу там, где карта читает веса модели быстрее, чем их обсчитывает. Вторая — FP4: пятое поколение тензорных ядер Blackwell считает в четырёхбитной точности нативно, тогда как у 4090 потолок FP8. Для моделей, которые корректно квантуются в FP4, это отдельный рычаг ускорения поверх памяти.
Остальное — контекст. Больше ядер, больше кэша, выше энергопотребление: всё работает на итог, но не оно решает, стоит ли доплата.
Где доплата за 5090 окупается
Разница между картами не абстрактная — она проявляется в конкретных режимах. Разложим их по тому, упирается задача в память или в вычисления.
Инференс LLM на 13–30B
Это главный аргумент за 5090. На моделях такого размера карта упирается не в вычисления, а в скорость чтения весов из памяти, а тут у Blackwell преимущество в 78%. Прирост пропускной способности конвертируется в throughput почти линейно: ускорение заметное, а не косметическое.
Точные tokens/sec назвать честно нельзя. Они зависят от модели, кванта и рантайма — vLLM, llama.cpp и TensorRT-LLM дают разные цифры на одном железе. Если для вас это критично, прогоните свою связку на почасовой аренде обеих карт и померьте на своих весах; свежие сравнения по популярным моделям несложно найти в бенчмарк-тредах Hugging Face. Направление известно заранее: на 13–30B 5090 ощутимо впереди.
Vision-инференс с высоким throughput
Генерация изображений — SDXL, Flux — на пакетном инференсе тоже упирается в память. Логика та же, что и с LLM: чем быстрее память, тем больше картинок в секунду с одной карты. Для продукта с пиковыми нагрузками на генерацию 5090 отдаёт заметно больше запросов на тот же GPU.
Дообучение 7–13B через LoRA
Здесь режим ближе к compute-bound, и преимущество 5090 держится, но по другой причине — за счёт ядер, а не памяти. На большом числе прогонов экономия времени на эпоху складывается в реальные часы. Гоняете много экспериментов — почувствуете.
Модели с поддержкой FP4
Свежие модели — Llama 3.1, Mistral Nemo и другие — квантуются в FP4 без серьёзной потери качества. На таких весах включается нативный FP4 у 5090, которого на 4090 попросту нет. Для production-инференса под нагрузкой, где FP4-деградация приемлема, выбор в пользу 5090 однозначен.
Где разницу платить не за что
Столько же сценариев, где 5090 почти не отрывается от 4090, и переплата не окупается.
Небольшие модели до 7B
Phi-3 mini, Qwen2 7B, Llama 3 8B на 4090 уже идут близко к потолку по токенам в секунду. 5090 быстрее, но прибавка невелика, а цена выше заметно. Для этого класса 4090 — рациональный выбор.
Пакетная обработка без требований к латентности
Если задача — прогнать за ночь миллион документов, а не ответить пользователю за секунду, разница между картами размывается. На таких batch-джобах отношение throughput к цене нередко лучше у 4090.
Инференс на тяжёлом кванте
На сильно квантованных весах (llama.cpp Q4_K_M и подобное) узким местом становятся вычисления, а не память. Преимущество 5090 по bandwidth здесь работает вполсилы, и 4090 держится почти вровень.
Vision с batch=1
ControlNet, IP-Adapter, генерация одной картинки — пропускная способность памяти тут не бутылочное горлышко. 5090 быстрее, но не настолько, чтобы это меняло выбор.
Цены в РФ-облаках
Карты есть у шести провайдеров на 4090 и у пяти на 5090 — всего в каталоге РФ 11 провайдеров с GPU. Ниже — минимальный по цене одиночный вариант каждой карты у каждого. Конфигурация хоста (vCPU / RAM / диск) у всех разная, поэтому колонку цены нельзя читать в лоб — смотрите её рядом с обвязкой.
RTX 4090 (24 ГБ)
| Провайдер | Конфиг (vCPU/RAM/диск) | Локация | ₽/мес | ₽/час | Подробнее |
|---|---|---|---|---|---|
| AdminVPS | 8 / 64 / 240 | Исландия | 28 669 | — | → |
| IQHost | 8 / 16 / 120 | Москва | 29 240 | 55,00 | → |
| immers.cloud | 8 / 16 / 40 | Москва | 44 690 | 82,76 | → |
| Cloud4Y | 16 / 64 / 500 | Москва | 72 061 | — | → |
| GPUDC | 8 / 128 / 400 | Москва | — (почасовая) | 100,00 | → |
Отдельно стоит FirstVDS: под именем «RTX 4090» там модифицированная карта на 48 ГБ («4090 Turbo»), а не референсная 24-гигабайтная. Её 61 500 ₽/мес — цена за другую железку, в один ряд с обычной 4090 её ставить нельзя.
RTX 5090 (32 ГБ)
| Провайдер | Конфиг (vCPU/RAM/диск) | Локация | ₽/мес | ₽/час | Подробнее |
|---|---|---|---|---|---|
| IQHost | 4 / 8 / 120 | Москва | 38 250 | 72,08 | → |
| FirstVDS | 4 / 16 / 250 | Москва | 53 465 | — | → |
| immers.cloud | 8 / 32 / 60 | Москва | 70 610 | 130,76 | → |
| Cloud4Y | 16 / 64 / 500 | Москва | 108 449 | — | → |
| GPUDC | 16 / 256 / 400 | Москва | — (почасовая) | 150,00 | → |
Цены — на дату статьи; у immers месячная со скидкой за предоплату 30 дней. Кроме одиночных карт, immers собирает конфигурации до 8× на обе модели — верхняя граница уходит за полмиллиона рублей в месяц, но это уже про multi-GPU, а не про выбор одной карты.
Что видно из цен
Дешевле всего 4090 берётся за рубежом: каталожный минимум держит AdminVPS в Исландии (28 669 ₽), но в России этой карты у него нет совсем. Самый дешёвый российский вариант — IQHost за 29 240 ₽. А 5090 в каталоге стоит только в Москве, ни одного зарубежного тарифа с ней нет.
Дальше — главное про «переплату за 5090». Сравнивать минимумы в лоб (38 250 против 28 669) бессмысленно: это московский IQHost против исландского AdminVPS. Честный ответ виден там, где у одного провайдера хост одинаковый, а меняется только карта. У immers таких пар восемь подряд, и надбавка на всех одна и та же — плюс 24 300 ₽/мес (или плюс 45 ₽/час):
| Конфиг (immers) | 4090 ₽/мес | 5090 ₽/мес | Надбавка |
|---|---|---|---|
| 8 / 32 / 160 | 46 840 | 71 140 | +24 300 |
| 16 / 64 / 160 | 52 256 | 76 556 | +24 300 |
| 32 / 128 / 160 | 63 094 | 87 394 | +24 300 |
Проценты, которыми обычно меряют такую разницу, здесь только сбивают: они гуляют от 39 до 52 исключительно потому, что дорожает хост, а не карта. Правильная формулировка — не «5090 дороже на столько-то процентов», а «5090 стоит фиксированные +24 300 ₽/мес к той же машине с 4090». У Cloud4Y единственная пара с идентичным хостом даёт +50%.
Наконец, почасовую оплату дают трое из шести — immers, IQHost и GPUDC. Для коротких экспериментов это меняет экономику; отдельный разбор часовых тарифов — в статье «Почасовая аренда GPU».
Decision tree: что брать под вашу задачу
1. Модель и режим.
- LLM до 7B, инференс → 4090 (прибавка 5090 не оправдывает цену);
- LLM 13–30B, инференс → 5090 (bandwidth +78% даёт линейный прирост throughput);
- дообучение 7–13B (LoRA / QLoRA) → 5090 (экономия времени на эпоху);
- LLM от 30B → не consumer-карта, нужен L40S 48 ГБ или A100/H100 (см. раздел ниже);
- SDXL / Flux с высоким throughput → 5090;
- ControlNet, одиночная картинка → 4090;
- эксперименты на коротких сессиях → 4090 почасовая;
- модели с FP4 в проде → 5090 (нативный FP4).
2. Режим нагрузки.
- production-инференс 24/7 → месячный тариф любой из карт;
- короткие эксперименты → почасовая аренда (кто её даёт — в таблице выше);
- batch с мягкой латентностью → 4090 (лучше throughput на рубль);
- латентность-критичный инференс → 5090.
3. Бюджет. Российский минимум по 4090 — около 29 000 ₽/мес (IQHost), по 5090 — от 38 000 ₽/мес (IQHost, но там слабый хост на 4 vCPU). На одинаковой машине 5090 стоит фиксированные +24 300 ₽/мес к 4090. Если закладываете до ~30 000 — это 4090; под 5090 с полноценным хостом планка начинается около 70 000.
4. Локация. RTX 5090 в каталоге есть только в Москве. 4090 тоже в основном московская, но у AdminVPS она стоит за рубежом — Исландия, Нидерланды, Германия, США, — и там же её каталожный минимум. Если требований к data residency нет, Москвы хватает почти всем.
Когда нужна не consumer-карта, а L40S или A100
Есть кейсы, где доплата за датацентр-класс окупается.
Нагрузка 24/7 годами. Consumer-карты рассчитаны на игровой режим — пиковая нагрузка часами с перерывами. В режиме постоянного аптайма они изнашиваются быстрее датацентр-аналогов, и SLA провайдера на них обычно скромнее. L40S на 48 ГБ — та же архитектура Ada, что у 4090, но датацентр-класс: память с ECC, сертификация под круглосуточную работу, заметно больший ресурс.
Multi-GPU с быстрым обменом. Ни 4090, ни 5090, ни L40S не имеют NVLink — они соединяются только через PCIe, и для распределённого обучения обмен градиентами становится узким местом. NVLink есть у A100 и H100 (сотни ГБ/с против десятков у PCIe). Если вашему workload нужно несколько карт в одной связке, consumer и L40S не подходят, смотрите в сторону A100/H100.
Объём VRAM от 48 ГБ. 32 ГБ у 5090 — потолок consumer. Если модель не помещается (Llama 3.3 70B даже в QLoRA просит около 46 ГБ), нужен L40S на 48 ГБ либо A100 на 40/80 ГБ.
Что мы советуем
Для большинства команд, работающих с LLM до 30B и vision-моделями, выбор сводится к нескольким вариантам.
По умолчанию под ограниченный бюджет берут RTX 4090 на месяц: она закрывает большую часть продуктовой разработки. Доплата за RTX 5090 на месяц оправдана, когда узкое место в пропускной способности памяти: инференс 13–30B с высоким throughput, пакетная генерация SDXL, много параллельных запросов. Под эксперименты и POC, где карта нужна на часы, дешевле почасовая 4090. А если хочется запас по памяти и надёжность под круглосуточную работу без multi-GPU, разумный промежуток между consumer и H100 — L40S на 48 ГБ с ECC.
Где сравнить все GPU-тарифы
В каталоге VPScan собраны GPU-тарифы РФ-провайдеров с фильтрами по модели (4090, 5090, A100, H100 и другие), объёму VRAM, цене и локации. Цены в таблице — на дату этой статьи; российский GPU-рынок подвижный, состав меняется, поэтому перед арендой сверьте свежие цифры в каталоге — мы пересобираем его каждый день.
Это часть серии про GPU-облако в РФ:
- обзорный гайд «GPU-серверы в РФ 2026» — весь ландшафт от consumer до H100;
- «Почасовая аренда GPU: immers, IQHost и GPUDC» — когда час дешевле месяца, с точкой безубыточности.
