RTX 5090 нарасхват

Распространение AI-бума привело к скачку цен на все составляющие серверов и рабочих станций. NVIDIA держалась дольше других - что довольно странно, учитывая уровень монополизации рынка GPU, - но в конце концов присоединилась к жатве. Профессиональная линейка PCIe-карт семейства NVIDIA Blackwell за лето подорожала на 30–50%. В результате этого разработчики AI по всему миру начали массово закупать для своих серверов клиентские GeForce RTX 5090 . Вообще-то, NVIDIA запрещает развертывание программного обеспечения потребительских карт GeForce/Titan в дата-центрах. GeForce RTX 5090, установленная в сервере для использования в коммерческой среде, формально попадает под это ограничение. Но кого это остановит, на кону – деньги.
Короли на столе
Посягнув на потребительский сегмент, корпоративные закупщики опустошили каналы поставки, но не изменили расстановку сил в AI-станциях рабочего стола. Лучшие конфигурации по-прежнему основаны на сочетании видеокарт NVIDIA GeForce RTX 5090 (32 ГБ GDDR7) и RTX 5080 (16ГБ GDDR7) с многоядерными процессорами, 64-256 ГБ памяти DDR5 и быстрыми накопителями PCIe. Выбор GPU зависит от конкретных требований к локальным AI-задачам.
Стоимость станций выросла: за лето цены RTX 5090/RTX 5080, DDR5 и NVMe почти удвоились.
Умозрительную конкуренцию рабочим станциям на RTX 5090 составляют старшие ускорители RTX PRO 6000 Blackwell (96 ГБ) и настольные AI-компьютеры DGX Spark.
RTX PRO 6000
RTX PRO 6000 Blackwell обладает 96 ГБ памяти GDDR7 с поддержкой ECC, пропускной способностью 1792 ГБ/с и производительностью до 4000 AI TOPS при энергопотреблении 600 Вт. Ее версия для рабочих станций, RTX PRO 6000 Workstation, стоит примерно вчетверо дороже RTX 5090 – около $22,000.
Немного дешевле вариант RTX PRO 6000 Blackwell Max-Q Edition — с теми же 96 ГБ памяти GDDR7 и 24 064 ядрами CUDA, но несколько меньшей производительностью и ограниченным до 300 Вт энергопотреблением. Система охлаждения турбинного типа делает карту более компактной, что позволяет устанавливать несколько таких карт в одну рабочую станцию.
Две Max-Q в стандартном корпусе Tower обеспечивают 192 ГБ видеопамяти при суммарном энергопотреблении графических процессоров 600 Вт – столько же, как одна RTX PRO 6000 Workstation. Если AI задачи больше зависят от объема видеопамяти, чем от вычислительной мощности, такую плотность ресурсов в настольной рабочей станции трудно превзойти.
RTX 5090 или DGX Spark?
Одна видеокарта RTX 5090 стоит почти как целый компьютер DGX Spark. Его покупают прежде всего ради большого объема памяти – 128 ГБ, когда нужно запускать большие модели без квантования или выполнять дообучение, где 32 ГБ памяти RTX 5090 недостаточно. DGX Spark привлекает тихой работой и низким энергопотреблением – всего 240 Вт против более 1000 Вт в ПК с RTX 5090.
|
NVIDIA DGX Spark |
Рабочая станция с RTX 5090 |
|
|
Назначение |
Локальное прототипирование огромных AI-моделей |
Универсальная рабочая станция (AI, 3D, видео, игры) |
|
Объем памяти |
128 ГБ (общая LPDDR5X) |
32 ГБ (собственно GDDR7) |
|
Скорость памяти |
273 ГБ/с |
1792 ГБ/с |
|
Ядро CUDA |
6 144 |
21 760 |
|
Энергопотребление |
~240 Вт (вся система) |
575 Вт (только видеокарта) |
Где DGX Spark проигрывает:
- Пропускная способность памяти
RTX 5090 оснащена памятью GDDR7 с пропускной способностью 1792 ГБ/с — примерно в четыре раза выше, чем у DGX Spark, поэтому в задачах генерации текста и изображений на моделях, которые помещаются в доступный объем памяти RTX 5090, она может быть значительно быстрее. DGX Spark базируется на мобильной архитектуре Grace Blackwell и использует общую унифицированную память LPDDR5X с 256-битной шиной и пропускной способностью 273 ГБ/с. Из-за такой относительно медленной подсистемы памяти первичная обработка запросов в Spark может иметь более высокую задержку по сравнению с RTX 5090. - «Сырая» вычислительная мощность
GeForce RTX 5090 имеет 21 760 ядер CUDA против 6 144 в DGX Spark. - ОС и совместимость
Рабочие станции из RTX 5090 работают на классической архитектуре x86 (Intel/AMD) под Windows или Ubuntu. DGX Spark – это ARM-компьютер со специализированной ОС NVIDIA DGX OS. Портирование программного обеспечения на него требует адаптации.
RTX 5090 или RTX 5080?
Ключевое отличие между двумя картами состоит в объеме памяти: 32 ГБ против 16 ГБ определяют, какие модели можно запускать.
|
|
RTX 5090 |
RTX 5080 |
|---|---|---|
|
Архитектура |
Blackwell (GB202) |
Blackwell (GB203) |
|
VRAM |
32 GB GDDR7 |
16 GB GDDR7 |
|
Memory Bandwidth |
1,792 GB/s |
960 GB/s |
|
Memory Bus |
512-bit |
256-bit |
|
CUDA Cores |
21,760 |
10,752 |
|
Tensor Cores |
680 (5th gen) |
336 (5th gen) |
|
FP16 Performance |
104.8 TFLOPS |
56.3 TFLOPS |
|
TDP |
575W |
360W |
|
Рыночная цена (октябрь 2026) |
~$5,500 |
~$1,900 |
В обзоре https://localaimaster.com/blog/rtx-5090-vs-5080-local-ai собраны сравнения RTX 5090 и RTX 5080 по скорости инференса, совместимости моделей, стоимости обработки токенов. Показатели производительности измерены с помощью Ollama и llama.cpp.
Скорость генерации токенов – это важнейший показатель для интерактивного использования.
|
Модель |
Квантизация |
RTX 5090 |
RTX 5080 |
|---|---|---|---|
|
Llama 3.1 8В |
Q4_K_M |
~213 tok/s |
~132 tok/s |
|
Qwen 2.5 14B |
Q4_K_M |
~145 tok/s |
~85 tok/s |
|
Qwen 2.5 32B |
Q4_K_M |
~45 tok/s |
~20 tok/s |
|
Llama 3.3 70B |
Q2_K |
~25-30 ток/с (est.) |
offloads |
|
DeepSeek R1 32B |
Q4_K_M |
~45 tok/s |
~18 tok/s |
Преимущество RTX 5090 увеличивается с ростом размера модели. Для моделей 8B она работает примерно на 60% быстрее. В случае моделей с 32B+, где «узким местом» становится видеопамять, RTX 5090 обеспечивает в 2–3 раза более высокую скорость по сравнению с RTX 5080 с 16 ГБ памяти, поскольку полностью избегает выгрузки данных в системную оперативную память.
Производительность инференса в больших языковых моделях ограничивается пропускной способностью памяти, а не вычислительной мощностью. Именно это является главной причиной более быстрой генерации токенов RTX 5090, а не удвоенное количество ядер CUDA. Показатель 960 ГБ/с у модели 5080 также обеспечивает отличные результаты для моделей, которые помещаются в 16 ГБ памяти.
RTX 5080 обеспечивает работу моделей размером 7B–13B на полной скорости, легко справляется со Stable Diffusion XL и выдает 132 токена/с на моделях 8B.
RTX 5090 необходима для работы с моделями 30B+. Объем видеопамяти 32 ГБ позволяет полностью разместить в ней модели Qwen 2.5 32B, DeepSeek R1 32B и квантованные модели 70B. Благодаря скорости 213 токенов/с на моделях 8B это самый быстрый графический процессор для инференса.
Для массовых задач – от быстрого инференса небольших LLM до рендеринга и дизайна – покупка системы с RTX 5090 остается основным выбором по уровню производительности и удобства:
- 32 GB VRAM. Для локальных LLM это очень важно. Там, где модель укладывается в 32 GB, высокая пропускная способность памяти гарантирует быструю генерацию токенов.
- CUDA . Зрелая программная экосистема
- FP4/Blackwell . Поддержка низкой точности важна именно для инференса.
- Цена . Вместо одной RTX PRO 6000 можно купить четыре RTX 5090 или мощную рабочую станцию с RTX 5090.
Обзор AI-прелестей RTX 5090 собран по ссылке .
Рабочая станция с двумя RTX 5090
Производительность AI-инференса масштабируется по GPU. Две карты RTX 5090 (общей стоимостью ~$11000) обеспечивают 64 ГБ суммарной видеопамяти с обменами через шину PCIe 5.0. Этого достаточно для запуска модели 70B (квантизация Q4_K_M) в полном качестве и с большим объемом контекста. Локальные системы с двумя RTX 5090 являются наиболее экономически выгодным способом достижения производительности уровня корпоративных систем.
С двумя GPU требования ко всей платформе возрастают:
- PCIe x16/x16 непосредственно от CPU;
- 128–256 ГБ RAM ;
- PSU 1800 Вт и более ;
- большой корпус;
- мощное охлаждение;
- физическое разнесение GPU.
Для двойных конфигураций с RTX 5090 NVIDIA рекомендует платформу AMD Threadripper PRO.
Текущее положение дел
Массовая увлеченность AI превратила RTX 5090 из флагманской игровой видеокарты в востребованный ускоритель для локального инференса. Мощный коммерческий спрос в дополнение к потребительскому сделал видеокарты дефицитными, а цены на них заоблачными.
