RTX 5090 нарозхват

Поширення AI-буму призвело до стрибка цін на всі складові серверів та робочих станцій. NVIDIA трималась довше за інших - що доволі дивно з огляду на рівень монополізації ринку GPU, - але зрештою долучилася до жнив. Професійна лінійка PCIe-карт сімейства NVIDIA Blackwell за літо подорожчала на 30-50%. Внаслідок цього розробники AI по всьому світу почали масово закуповувати для своїх серверів клієнтські GeForce RTX 5090. Взагалі-то NVIDIA забороняє розгортання програмного забезпечення споживчих карт GeForce/Titan у дата-центрах. GeForce RTX 5090, встановлена у сервер для використання у комерційному середовищі, формально потрапляє під це обмеження. Але кого це зупинить, на кону - гроші.
Королі на столі
Посягнувши на споживчий сегмент, корпоративні закупівельники спустошили канали постачання, але не змінили розстановки сил у AI-станціях робочого столу. Найкращі конфігурації, як і раніше, базуються на поєднанні відеокарт NVIDIA GeForce RTX 5090 (32 ГБ GDDR7) та RTX 5080 (16ГБ GDDR7) із багатоядерними процесорами, 64–256 ГБ пам’яті DDR5 та швидкими накопичувачами PCIe 5.0 NVMe. Вибір GPU залежить від конкретних вимог до локальних AI-завдань.
Вартість станцій зросла: протягом літа ціни RTX 5090/RTX 5080, DDR5 та NVMe майже подвоїлися.
Умоглядну конкуренцію робочим станціям на RTX 5090 становлять старші прискорювачі RTX PRO 6000 Blackwell (96 ГБ) та настільні AI-комп’ютери DGX Spark.
RTX PRO 6000
RTX PRO 6000 Blackwell має 96 ГБ пам'яті GDDR7 з підтримкою ECC, пропускну здатність 1792 ГБ/с і продуктивність до 4000 AI TOPS при енергоспоживанні 600 Вт. Її версія для робочих станцій, RTX PRO 6000 Workstation, коштує приблизно вчетверо дорожче за RTX 5090 — близько $22,000.
Ненабагато дешевшим є варіант RTX PRO 6000 Blackwell Max-Q Edition — із тими самими 96 ГБ пам'яті GDDR7 і 24 064 ядрами CUDA, але дещо меншою продуктивністю та обмеженим до 300 Вт енергоспоживанням. Система охолодження турбінного типу робить карту компактнішою, що дозволяє встановлювати кілька таких карт в одну робочу станцію.
Дві Max-Q у стандартному корпусі Tower забезпечують 192 ГБ відеопам'яті при сумарному енергоспоживанні графічних процесорів 600 Вт — стільки ж, як одна RTX PRO 6000 Workstation. Якщо AI-завдання більше залежать від обсягу відеопам'яті, ніж від обчислювальної потужності, таку щільність ресурсів у настільній робочій станції важко перевершити.
RTX 5090 чи DGX Spark?
Одна відеокарта RTX 5090 коштує майже як цілий комп’ютер DGX Spark. Його купують передусім заради великого обсягу пам’яті — 128 ГБ, коли потрібно запускати великі моделі без квантування або виконувати донавчання, для якого 32 ГБ пам’яті RTX 5090 недостатньо. DGX Spark приваблює тихою роботою та низьким енергоспоживанням — лише 240 Вт проти понад 1000 Вт у ПК з RTX 5090.
|
NVIDIA DGX Spark |
Робоча станція з RTX 5090 |
|
|
Призначення |
Локальне прототипування величезних AI-моделей |
Універсальна робоча станція (AI, 3D, відео, ігри) |
|
Об'єм пам'яті |
128 ГБ (спільна LPDDR5X) |
32 ГБ (власна GDDR7) |
|
Швидкість пам'яті |
273 ГБ/с |
1792 ГБ/с |
|
Ядра CUDA |
6 144 |
21 760 |
|
Енергоспоживання |
~240 Вт (вся система) |
575 Вт (тільки відеокарта) |
Де DGX Spark програє:
- Пропускна здатність пам'яті
RTX 5090 оснащена пам'яттю GDDR7 із пропускною здатністю 1 792 ГБ/с — приблизно в чотири рази вищою, ніж у DGX Spark, тому в задачах генерації тексту та зображень на моделях, які вміщуються в доступний обсяг пам'яті RTX 5090, вона може бути значно швидшою. DGX Spark базується на мобільній архітектурі Grace Blackwell і використовує спільну уніфіковану пам'ять LPDDR5X із 256-бітною шиною та пропускною здатністю 273 ГБ/с. Через таку відносно повільну підсистему пам'яті первинна обробка запитів у Spark може мати вищу затримку порівняно з RTX 5090. - «Сира» обчислювальна потужність
GeForce RTX 5090 має 21 760 ядер CUDA проти 6 144 у DGX Spark. - ОС і сумісність
Робочі станції з RTX 5090 працюють на класичній архітектурі x86 (Intel/AMD) під Windows або Ubuntu. DGX Spark — це ARM-комп'ютер зі спеціалізованою ОС NVIDIA DGX OS. Портування програмного забезпечення на нього потребує адаптації.
RTX 5090 чи RTX 5080?
Ключова відмінність між двома картами полягає в обсязі пам’яті: 32 ГБ проти 16 ГБ визначають, які моделі можна запускати.
|
|
RTX 5090 |
RTX 5080 |
|---|---|---|
|
Архітектура |
Blackwell (GB202) |
Blackwell (GB203) |
|
VRAM |
32 GB GDDR7 |
16 GB GDDR7 |
|
Memory Bandwidth |
1,792 GB/s |
960 GB/s |
|
Memory Bus |
512-bit |
256-bit |
|
CUDA Cores |
21,760 |
10,752 |
|
Tensor Cores |
680 (5th gen) |
336 (5th gen) |
|
FP16 Performance |
104.8 TFLOPS |
56.3 TFLOPS |
|
TDP |
575W |
360W |
|
Ринкова ціна (жовтень 2026) |
~$5,500 |
~$1,900 |
У огляді https://localaimaster.com/blog/rtx-5090-vs-5080-local-ai зібрані порівняння RTX 5090 та RTX 5080 за швидкістю інференсу, сумісністю моделей, вартістю обробки токенів. Показники продуктивності виміряні за допомогою Ollama та llama.cpp.
Швидкість генерації токенів — це найважливіший показник для інтерактивного використання.
|
Модель |
Квантизація |
RTX 5090 |
RTX 5080 |
|---|---|---|---|
|
Llama 3.1 8B |
Q4_K_M |
~213 tok/s |
~132 tok/s |
|
Qwen 2.5 14B |
Q4_K_M |
~145 tok/s |
~85 tok/s |
|
Qwen 2.5 32B |
Q4_K_M |
~45 tok/s |
~20 tok/s |
|
Llama 3.3 70B |
Q2_K |
~25-30 tok/s (est.) |
offloads |
|
DeepSeek R1 32B |
Q4_K_M |
~45 tok/s |
~18 tok/s |
Перевага RTX 5090 зростає зі збільшенням розміру моделі. Для моделей 8B вона працює приблизно на 60% швидше. У випадку моделей із 32B+, де «вузьким місцем» стає відеопам’ять, RTX 5090 забезпечує у 2–3 рази вищу швидкість порівняно з RTX 5080 із 16 ГБ пам’яті, оскільки вона повністю уникає вивантаження даних у системну оперативну пам’ять.
Продуктивність інференсу у великих мовних моделях обмежується пропускною здатністю пам'яті, а не обчислювальною потужністю. Саме це є головною причиною швидшої генерації токенів RTX 5090, а не подвоєна кількість ядер CUDA. Показник 960 ГБ/с у моделі 5080 також забезпечує відмінні результати для моделей, що вміщуються в її 16 ГБ пам'яті.
RTX 5080 забезпечує роботу моделей розміром 7B–13B на повній швидкості, легко справляється зі Stable Diffusion XL і видає 132 токени/с на моделях 8B.
RTX 5090 необхідна для роботи з моделями 30B+. Обсяг відеопам'яті 32 ГБ дозволяє повністю розмістити в ній моделі Qwen 2.5 32B, DeepSeek R1 32B та квантовані моделі 70B. Завдяки швидкості 213 токенів/с на моделях 8B це найшвидший споживчий графічний процесор для інференсу.
Для масових завдань — від швидкого інференсу невеликих LLM до рендерингу та дизайну — покупка системи з RTX 5090 залишається основним вибором за рівнем продуктивності та зручності:
- 32 GB VRAM. Для локальних LLM це дуже суттєво. Там, де модель вкладається в 32 GB, висока пропускна здатність пам’яті гарантує швидку генерацію токенів.
- CUDA. Зріла програмна екосистема
- FP4 / Blackwell. Підтримка низької точності важлива саме для інференсу.
- Ціна. Замість однієї RTX PRO 6000 можна купити чотири RTX 5090 або потужну робочу станцію з RTX 5090.
Огляд AI-принад RTX 5090 зібрано за посиланням.
Робоча станція з двома RTX 5090
Продуктивність AI-інференсу масштабується за GPU. Дві карти RTX 5090 (загальною вартістю ~$11000) забезпечують 64 ГБ сумарної відеопам’яті з обмінами через шину PCIe 5.0. Цього достатньо для запуску моделі 70B (квантування Q4_K_M) у повній якості та з великим обсягом контексту. Локальні системи з двома RTX 5090 є найбільш економічно вигідним шляхом до отримання продуктивності рівня корпоративних систем.
З двома GPU вимоги до всієї платформи зростають:
- PCIe x16/x16 безпосередньо від CPU;
- 128–256 ГБ RAM;
- PSU 1800 Вт і більше;
- великий корпус;
- потужне охолодження;
- фізичне рознесення GPU.
Для подвійних конфігурацій з RTX 5090 NVIDIA рекомендує платформу AMD Threadripper PRO.
Поточний стан справ
Масова захопленість AI перетворила RTX 5090 із флагманської ігрової відеокарти на затребуваний прискорювач для локального інференсу. Потужний комерційний попит на додачу до споживчого зробив відеокарти дефіцитними, а ціни на них — захмарними.
