Земная жизнь серверов с несколькими GPU

Рынок серверов с несколькими графическими процессорам (2-8 GPU и более) в основном подпитывается развитием искусственного интеллекта. Ориентировочное распределение спроса выглядит следующим образом:
- AI и машинное обучение - 60-80%
- HPC и научные расчеты – 10–20%
- Профессиональная графика, рендеринг, VFX - 5-15%
- Виртуализация рабочих мест (VDI/vGPU) - 5-10%
Кроме облачных «небожителей», собственную AI-инфраструктуру активно разворачивают корпоративные центры обработки данных, средние и крупные компании, стремящиеся запускать собственные LLM и AI-сервисы: банки, телеком-операторы, промышленные холдинги, розничные сети.
Их типичный сценарий – сервер с 2–8 GPU для RAG-систем, корпоративных чат-ботов, анализа документов, поиска знаний и рекомендательных систем. Серверы с несколькими GPU активно используются в научных исследованиях, инженерном моделировании, симуляциях, обработке больших массивов данных, профессиональной визуализации.
Дефицит – двигатель торговли
На рынке профессиональных графических ускорителей для AI образовался дефицит H200 NVL. Основные причины таковы:
- Ограниченное предложение HBM3e. Критическим компонентом H200 является не столько сам GPU, сколько 141 ГБ памяти HBM3e. Производство HBM остается одним из главных сдерживающих факторов дальнейшего раздувания AI-пузыря. SK Hynix, Samsung и Micron не успевают за спросом.
- Приоритет гиперскейлеров. В первую очередь NVIDIA выполняет контракты крупнейших клиентов — Microsoft, Amazon, Google, Oracle, Meta, xAI и OpenAI. OEM-производители серверов (Dell, HPE, Lenovo, Supermicro) получают меньшие квоты, остальному рынку достаются крохи, с длительными сроками ожидания.
- Популярность H200 NVL для инференса. Несколько H200 NVL обеспечивают достаточный объем памяти для запуска больших языковых моделей. Это привлекательная характеристика для корпоративных серверов, где требуется высокая производительность при более умеренных требованиях к энергопотреблению и стоимости, чем у систем на базе старших B200, B300, GB200.
- Переориентация производства на Blackwell. NVIDIA постепенно переносит производственные мощности на B200, B300, GB200 и будущие платформы Rubin. Компания не заинтересована в существенном расширении выпуска Hopper – архитектуры, к которой принадлежит H200, даже несмотря на высокий спрос.
Для больших AI-облаков H200 NVL никогда не являлся основным продуктом. Там доминируют SXM/HGX-системы с GPU, объединенными скоростными NVLink/NVSwitch в составе масштабируемой AI-инфраструктуры. Высокое искусство требует жертв:
- потребляемая мощность современного B200 достигает примерно 1000 Вт, что значительно превышает возможности стандартных PCIe-карт;
- для раскрытия полной производительности требуется NVLink 5, реализуемый в платформах HGX;
- такие системы почти всегда нуждаются в жидкостном охлаждении.
H200 NVL стал популярным решением для скромных облачных операторов, наземных корпораций и исследовательских лабораторий с конфигурациями до 8 GPU и поддержкой NVLink. Эти ускорители заняли нишу своеобразной «золотой середины»: они значительно превосходят H100 благодаря HBM3e, но в то же время проще и дешевле Blackwell-систем B200, GB200, B300.
Теперь рынок относительно доступных GPU-серверов, вероятно, разделится на несколько сегментов.
Народный Blackwell
NVIDIA предлагает RTX PRO 6000 Blackwell Server Edition, PCIe-ускорители для AI-инференса, агентных систем, корпоративных серверов. Карты оснащены 96 ГБ GDDR7 ECC, имеют умеренное энергопотребление и двухслотовый дизайн, подобный H200 NVL. В типовом сервере можно разместить 8-10 таких GPU.
RTX PRO 6000 не заменят H200 NVL для больших моделей, однако могут отобрать значительную часть рынка локального AI, RAG-систем, CAD+AI и видеоаналитики.
Сохраняется устойчивый спрос на серверы с несколькими GeForce RTX 5090. Их преимущества – высокая производительность, 32 ГБ GDDR7 на GPU, доступность через потребительский канал поставки и демократичная цена – около $4.5K за ускоритель.
Недостатки RTX PRO 6000 и RTX 5090 по сравнению с H200 NVL – более медленная память GDDR7 и отсутствие NVLink – вполне приемлемый компромисс для многих сценариев AI-инференса. В то же время поддержка низкоразрядных форматов FP4 и FP8 архитектурой Blackwell в определенной степени нивелирует преимущества HBM большой емкости, позволяя более эффективно использовать доступный объем видеопамяти.
Серверы с 2–4 RTX PRO 6000 Blackwell или 2–4 RTX 5090 значительно доступнее HGX-платформ, но уже позволяют запускать модели уровня Llama 70B, Qwen 72B локально. Для многих организаций они становятся реальной альтернативой дорогим кластерам H100/H200.
Окно возможностей для AMD
Недавно AMD анонсировала GPU Instinct MI350P – первую с 2022 года PCIe-карту серии Instinct, которую можно установить в любой сервер с поддержкой двухслотных GPU с воздушным охлаждением. AMD не реализовала на MI350P прямые каналы обмена данными между GPU через Infinity Fabric. Все межкарточное взаимодействие происходит через PCIe 5.0 x16 с соответствующим ограничением скорости. Восемь карточек в сервере – это восемь изолированных ускорителей, без возможности объединения в единый высокоскоростной домен памяти - один из главных недостатков новинки.
Впрочем, отсутствие H200 NVL дает шанс для Instinct MI350P. Новый ускоритель оснащен 144 ГБ памяти HBM3e против 141 ГБ H200 NVL. Кроме того, его архитектура более современна, тогда как H200 NVL – это поколение Hopper почтенного возраста. Для серверов с несколькими GPU у NVIDIA есть RTX Pro 6000 Blackwell Server Edition с 96 ГБ GDDR7, но нет ничего демократичного на памяти HBM3e.
|
Характеристика |
AMD MI350P |
NVIDIA H200 NVL |
NVIDIA RTX PRO 6000 SE |
|---|---|---|---|
|
Пам'ять |
144 ГБ HBM3e |
141 ГБ HBM3e |
96 ГБ GDDR7 ECC |
|
Пропускна здатність пам'яті |
3.6 ТБ/с (стала), 4.0 ТБ/с (пікова) |
4.8 ТБ/с |
1.6 ТБ/с |
|
Поділ GPU |
До 4 розділів по 36 ГБ |
До 7 MIG по ~16.5 ГБ |
До 4 MIG по 24 ГБ |
|
Масштабування |
PCIe |
NVLink 900 ГБ/с (2-/4-way) |
PCIe |
|
Інтерфейс підключення до хоста |
PCIe Gen5 x16 — 128 ГБ/с |
PCIe Gen5 x16 — 128 ГБ/с |
PCIe Gen5 x16 — 128 ГБ/с |
|
Максимальне енергоспоживання плати |
600 Вт (450 Вт у деяких конфігураціях) |
600 Вт (залежно від конфігурації) |
600 Вт |
|
Ціна |
Поки що невідома |
Була ~$40K |
~$15K |
Поддержка FP4 более новыми GPU частично девальвирует главное преимущество H200 NVL – большой объем памяти. То, что в 2024 году требовало 141 ГБ HBM3e, в 2026 году часто помещается в 96 ГБ GDDR7. Сегодня дефицит H200 уже не выглядит столь катастрофическим для корпоративного сегмента, сколь мог бы два года назад. AMD Instinct MI350P со 144 ГБ памяти HBM3e будет иметь преимущество еще и из-за поддержки низкоразрядных форматов вычислений.
|
Формат |
AMD MI350P Peak |
NVIDIA H200 NVL Sparse |
NVIDIA RTX PRO 6000 SE Sparse |
|---|---|---|---|
|
BF16 |
1,150 TFLOPS |
1,671 TFLOPS |
1,000 TFLOPS |
|
FP16 |
1,150 TFLOPS |
1,671 TFLOPS |
1,000 TFLOPS |
|
FP8 |
2,300 TFLOPS |
3,341 TFLOPS |
2,000 TFLOPS |
|
FP4 |
4,600 TFLOPS |
— |
4,000 TFLOPS |
Из этой таблицы видно: RTX PRO 6000 Blackwell Server Edition почти догоняет H200 NVL у FP4 (4 PFLOPS против 3,3 PFLOPS FP8 у H200 NVL), но проигрывает из-за втрое меньшей пропускной способности памяти (1,6 против 4,8 ТБ/с) . Именно поэтому для больших LLM производительность часто упирается не в тензорные ядра, а в память и межпроцессорный обмен данными.
Главным барьером для AMD остается программное окружение. Платформа AMD ускорения вычислений на GPU ROCm (Radeon Open Compute) является ближайшим аналогом NVIDIA CUDA. Но CUDA существует с 2007 года, и за это время вокруг нее сформировалась огромная экосистема. Практически все новые модели AI первоначально разрабатываются и оптимизируются именно под CUDA. AMD избрала другой подход. Основная идея ROCm – не создать отдельный мир, а максимально обеспечить совместимость с CUDA. Значительную часть CUDA-кода можно конвертировать для работы в среде AMD.
Программный стек AMD для AI основан на Kubernetes GPU Operator, AMD Inference Microservices и открытых инструментах машинного обучения. Компания заявляет о нативной поддержке PyTorch и активно развивает интеграцию с популярными AI-фреймворками. Для новых проектов, где нет жесткой привязки к CUDA, ROCm уже вполне рабочий вариант. Миграция существующих решений, оптимизированных библиотек и специфических инструментов потребует дополнительных усилий.
Основные слабые стороны ROCm: меньше оптимизированных библиотек, меньше инструментов профилирования, меньше документации и примеров. Для большинства исследователей и компаний CUDA остается удобным выбором благодаря зрелой экосистеме, широкой поддержке библиотек и быстрому появлению оптимизации для новых моделей.
ROCm уже давно нельзя считать экспериментальной платформой. Это зрелая среда для профессиональных вычислений, обучения и инференса AI-моделей. Однако по масштабу экосистемы, количеству оптимизированных инструментов и скорости внедрения новых возможностей CUDA пока сохраняет заметное преимущество.
Главная интрига Instinct MI350P заключается не в аппаратных характеристиках. По объему памяти HBM3e и возможностям инференса новинка выглядит вполне конкурентоспособной. Вопрос в том, готовы ли корпоративные заказчики променять привычки на более привлекательные характеристики и потенциально более низкую стоимость владения.
Перераспределение рынка
Формально, текущий кастинг кандидатов в серверы с несколькими GPU выглядит следующим образом:
|
Для чого |
Найкращий вибір |
|---|---|
|
Максимальний обсяг пам'яті на GPU |
AMD MI350P (144 ГБ) |
|
Максимальна пропускна здатність пам'яті |
NVIDIA H200 NVL (4.8 ТБ/с) |
|
Масштабування 2–4 GPU з низькою латентністю |
NVIDIA H200 NVL (NVLink 900 ГБ/с) |
|
Робочі станції, CAD, рендеринг |
NVIDIA RTX PRO 6000 SE |
|
Локальні LLM та AI-сервери без NVLink |
AMD MI350P або RTX PRO 6000 SE |
|
Графіка + AI в одному прискорювачі |
NVIDIA RTX PRO 6000 SE |
H200 NVL был почти идеальным продуктом для умеренно дорогих серверов с 4–8 GPU. Его дефицит ускорит исход: крупные компании пойдут в HGX, а средние – в RTX PRO, RTX 5090 и альтернативные PCIe AI-ускорители.
|
Сегмент |
Перспектива |
|
HGX/B200/B300 |
«Табір іде в небо» |
|
RTX PRO multi-GPU |
Зростання |
|
RTX 5090 workstation/server |
Швидке зростання |
|
AMD Instinct |
Отримає шанс |
Классические серверы с несколькими PCIe GPU останутся фундаментом AI-инфраструктуры "на земле". Рынок, на протяжении многих лет не получавший новых PCIe-графических процессоров с HBM-памятью, ожидает появления конкурентных предложений.
