RTX 5090 нарасхват

29.09.2026 | Станции

 

Распространение AI-бума привело к скачку цен на все составляющие серверов и рабочих станций. NVIDIA держалась дольше других - что довольно странно, учитывая уровень монополизации рынка GPU, - но в конце концов присоединилась к жатве. Профессиональная линейка PCIe-карт семейства NVIDIA Blackwell за лето подорожала на 30–50%. В результате этого разработчики AI по всему миру начали массово закупать для своих серверов клиентские GeForce RTX 5090 . Вообще-то, NVIDIA запрещает развертывание программного обеспечения потребительских карт GeForce/Titan в дата-центрах. GeForce RTX 5090, установленная в сервере для использования в коммерческой среде, формально попадает под это ограничение. Но кого это остановит, на кону – деньги.

 

Короли на столе

Посягнув на потребительский сегмент, корпоративные закупщики опустошили каналы поставки, но не изменили расстановку сил в AI-станциях рабочего стола. Лучшие конфигурации по-прежнему основаны на сочетании видеокарт NVIDIA GeForce RTX 5090 (32 ГБ GDDR7) и RTX 5080 (16ГБ GDDR7) с многоядерными процессорами, 64-256 ГБ памяти DDR5 и быстрыми накопителями PCIe. Выбор GPU зависит от конкретных требований к локальным AI-задачам.

Стоимость станций выросла: за лето цены RTX 5090/RTX 5080, DDR5 и NVMe почти удвоились.

Умозрительную конкуренцию рабочим станциям на RTX 5090 составляют старшие ускорители RTX PRO 6000 Blackwell (96 ГБ) и настольные AI-компьютеры DGX Spark.

 

RTX PRO 6000

RTX PRO 6000 Blackwell обладает 96 ГБ памяти GDDR7 с поддержкой ECC, пропускной способностью 1792 ГБ/с и производительностью до 4000 AI TOPS при энергопотреблении 600 Вт. Ее версия для рабочих станций, RTX PRO 6000 Workstation, стоит примерно вчетверо дороже RTX 5090 – около $22,000.

Немного дешевле вариант RTX PRO 6000 Blackwell Max-Q Edition — с теми же 96 ГБ памяти GDDR7 и 24 064 ядрами CUDA, но несколько меньшей производительностью и ограниченным до 300 Вт энергопотреблением. Система охлаждения турбинного типа делает карту более компактной, что позволяет устанавливать несколько таких карт в одну рабочую станцию.

Две Max-Q в стандартном корпусе Tower обеспечивают 192 ГБ видеопамяти при суммарном энергопотреблении графических процессоров 600 Вт – столько же, как одна RTX PRO 6000 Workstation. Если AI задачи больше зависят от объема видеопамяти, чем от вычислительной мощности, такую плотность ресурсов в настольной рабочей станции трудно превзойти.

 

RTX 5090 или DGX Spark?

Одна видеокарта RTX 5090 стоит почти как целый компьютер DGX Spark. Его покупают прежде всего ради большого объема памяти – 128 ГБ, когда нужно запускать большие модели без квантования или выполнять дообучение, где 32 ГБ памяти RTX 5090 недостаточно. DGX Spark привлекает тихой работой и низким энергопотреблением – всего 240 Вт против более 1000 Вт в ПК с RTX 5090.

 

 

NVIDIA DGX Spark

Рабочая станция с RTX 5090

Назначение

Локальное прототипирование огромных AI-моделей

Универсальная рабочая станция (AI, 3D, видео, игры)

Объем памяти

128 ГБ (общая LPDDR5X)

32 ГБ (собственно GDDR7)

Скорость памяти

273 ГБ/с

1792 ГБ/с

Ядро CUDA

6 144

21 760

Энергопотребление

~240 Вт (вся система)

575 Вт (только видеокарта)

 

Где DGX Spark проигрывает:

  • Пропускная способность памяти
    RTX 5090 оснащена памятью GDDR7 с пропускной способностью 1792 ГБ/с — примерно в четыре раза выше, чем у DGX Spark, поэтому в задачах генерации текста и изображений на моделях, которые помещаются в доступный объем памяти RTX 5090, она может быть значительно быстрее. DGX Spark базируется на мобильной архитектуре Grace Blackwell и использует общую унифицированную память LPDDR5X с 256-битной шиной и пропускной способностью 273 ГБ/с. Из-за такой относительно медленной подсистемы памяти первичная обработка запросов в Spark может иметь более высокую задержку по сравнению с RTX 5090.
  • «Сырая» вычислительная мощность
    GeForce RTX 5090 имеет 21 760 ядер CUDA против 6 144 в DGX Spark.
  • ОС и совместимость
    Рабочие станции из RTX 5090 работают на классической архитектуре x86 (Intel/AMD) под Windows или Ubuntu. DGX Spark – это ARM-компьютер со специализированной ОС NVIDIA DGX OS. Портирование программного обеспечения на него требует адаптации.

 

RTX 5090 или RTX 5080?

Ключевое отличие между двумя картами состоит в объеме памяти: 32 ГБ против 16 ГБ определяют, какие модели можно запускать.

 

 

RTX 5090

RTX 5080

Архитектура

Blackwell (GB202)

Blackwell (GB203)

VRAM

32 GB GDDR7

16 GB GDDR7

Memory Bandwidth

1,792 GB/s

960 GB/s

Memory Bus

512-bit

256-bit

CUDA Cores

21,760

10,752

Tensor Cores

680 (5th gen)

336 (5th gen)

FP16 Performance

104.8 TFLOPS

56.3 TFLOPS

TDP

575W

360W

Рыночная цена

(октябрь 2026)

~$5,500

~$1,900

 

В обзоре https://localaimaster.com/blog/rtx-5090-vs-5080-local-ai собраны сравнения RTX 5090 и RTX 5080 по скорости инференса, совместимости моделей, стоимости обработки токенов. Показатели производительности измерены с помощью Ollama и llama.cpp.

Скорость генерации токенов – это важнейший показатель для интерактивного использования.

 

                    Модель

                    Квантизация

                    RTX 5090

               RTX 5080

Llama 3.1 8В

Q4_K_M

~213 tok/s

~132 tok/s

Qwen 2.5 14B

Q4_K_M

~145 tok/s

~85 tok/s

Qwen 2.5 32B

Q4_K_M

~45 tok/s

~20 tok/s

Llama 3.3 70B

Q2_K

~25-30 ток/с (est.)

offloads

DeepSeek R1 32B

Q4_K_M

~45 tok/s

~18 tok/s

 

Преимущество RTX 5090 увеличивается с ростом размера модели. Для моделей 8B она работает примерно на 60% быстрее. В случае моделей с 32B+, где «узким местом» становится видеопамять, RTX 5090 обеспечивает в 2–3 раза более высокую скорость по сравнению с RTX 5080 с 16 ГБ памяти, поскольку полностью избегает выгрузки данных в системную оперативную память.

Производительность инференса в больших языковых моделях ограничивается пропускной способностью памяти, а не вычислительной мощностью. Именно это является главной причиной более быстрой генерации токенов RTX 5090, а не удвоенное количество ядер CUDA. Показатель 960 ГБ/с у модели 5080 также обеспечивает отличные результаты для моделей, которые помещаются в 16 ГБ памяти.

RTX 5080 обеспечивает работу моделей размером 7B–13B на полной скорости, легко справляется со Stable Diffusion XL и выдает 132 токена/с на моделях 8B.

RTX 5090 необходима для работы с моделями 30B+. Объем видеопамяти 32 ГБ позволяет полностью разместить в ней модели Qwen 2.5 32B, DeepSeek R1 32B и квантованные модели 70B. Благодаря скорости 213 токенов/с на моделях 8B это самый быстрый графический процессор для инференса.

Для массовых задач – от быстрого инференса небольших LLM до рендеринга и дизайна – покупка системы с RTX 5090 остается основным выбором по уровню производительности и удобства:

  • 32 GB VRAM. Для локальных LLM это очень важно. Там, где модель укладывается в 32 GB, высокая пропускная способность памяти гарантирует быструю генерацию токенов.
  • CUDA . Зрелая программная экосистема
  • FP4/Blackwell . Поддержка низкой точности важна именно для инференса.
  • Цена . Вместо одной RTX PRO 6000 можно купить четыре RTX 5090 или мощную рабочую станцию с RTX 5090.

Обзор AI-прелестей RTX 5090 собран по ссылке .

 

Рабочая станция с двумя RTX 5090

Производительность AI-инференса масштабируется по GPU. Две карты RTX 5090 (общей стоимостью ~$11000) обеспечивают 64 ГБ суммарной видеопамяти с обменами через шину PCIe 5.0. Этого достаточно для запуска модели 70B (квантизация Q4_K_M) в полном качестве и с большим объемом контекста. Локальные системы с двумя RTX 5090 являются наиболее экономически выгодным способом достижения производительности уровня корпоративных систем.

С двумя GPU требования ко всей платформе возрастают:

  • PCIe x16/x16 непосредственно от CPU;
  • 128–256 ГБ RAM ;
  • PSU 1800 Вт и более ;
  • большой корпус;
  • мощное охлаждение;
  • физическое разнесение GPU.

Для двойных конфигураций с RTX 5090 NVIDIA рекомендует платформу AMD Threadripper PRO.

 

Текущее положение дел

Массовая увлеченность AI превратила RTX 5090 из флагманской игровой видеокарты в востребованный ускоритель для локального инференса. Мощный коммерческий спрос в дополнение к потребительскому сделал видеокарты дефицитными, а цены на них заоблачными.