Рост числа GPU-серверов для обучения LLM: как бум искусственного интеллекта меняет архитектуру ЦОД

Эпоха доминирования CPU в ЦОД завершена: доля GPU-ускорителей в новых серверных закупках для Enterprise-сегмента за последние два года подскочила с 10-15% до 40-50%. Бум LLM перевел GPU из разряда вспомогательных карт для рендеринга в основной вычислительный узел, требующий полной перестройки архитектуры питания и охлаждения.

От общего количества к плотности вычислений

Количественный рост серверов перестал быть главным KPI. Сегодня рынок переходит к концепции «вычислительной плотности». Один современный сервер на базе NVIDIA H100 или A100 заменяет по производительности в задачах матричного умножения сотни стандартных CPU-узлов. Это создает парадокс: общее число физических «коробок» в некоторых сегментах растет медленнее, но потребление энергии на одну стойку увеличивается в 3-5 раз.

Пример: стандартная стойка на 5-7 кВт теперь превращается в высокоплотный кластер на 30-60 кВт. Если раньше в стойку ставили 20-30 серверов 1U, то теперь там могут разместиться 4-8 тяжелых GPU-серверов, которые по стоимости превышают весь старый парк оборудования. Экспертный вывод: инвестировать в простое расширение количества серверов бессмысленно — нужно пересчитывать TFLOPS на квадратный метр.

Технический разрыв: CPU vs GPU в архитектуре LLM

Обучение LLM требует колоссальной пропускной способности памяти (HBM) и сверхбыстрого интерконнекта. Обычный PCIe 4.0/5.0 становится «бутылочным горлышком». В профессиональных сборках используются проприетарные шины вроде NVLink, позволяющие GPU обмениваться данными на скоростях до 900 ГБ/с, что недоступно классическим серверным архитектурам.

Кейс: при попытке обучить модель среднего размера на CPU-кластере время итерации увеличивается в 50-100 раз по сравнению с GPU-кластером. Это делает стоимость аренды или владения CPU-мощностями для ИИ экономически катастрофической. Экспертный вывод: для задач инференса (вывода) еще можно использовать оптимизированные CPU, но для обучения LLM любые альтернативы GPU-серверам — это выброшенные деньги.

Энергетический коллапс и проблема охлаждения

Переход на GPU радикально меняет требования к инфраструктуре. Один сервер с 8 картами H100 потребляет около 10-12 кВт. Традиционное воздушное охлаждение (CRAC) перестает справляться при плотности выше 15-20 кВт на стойку, что ведет к локальному перегреву и троттлингу чипов, снижая их реальную производительность на 20-30%.

Решением становится внедрение СЖО (систем жидкостного охлаждения) и Direct-to-Chip охлаждения. Стоимость внедрения «водянки» в ЦОД увеличивает CAPEX на 25-40%, но это единственный способ избежать деградации дорогостоящего железа. Экспертный вывод: энергоэффективность современных дата-центров: как PUE влияет на масштабирование серверных сетей теперь определяется не столько оптимизацией кондиционеров, сколько переходом на жидкостный контур.

Экономика GPU-серверов: CAPEX и риски

Стоимость одного топового GPU-сервера (например, NVIDIA DGX) может варьироваться от $200 000 до $400 000. При этом жизненный цикл такого оборудования сократился до 2-3 лет из-за стремительного выхода новых архитектур (переход от Ampere к Hopper и далее). Это создает огромные риски амортизации.

Сравнение: классический сервер общего назначения служит 5-7 лет, теряя в цене линейно. GPU-сервер теряет 50% стоимости за первые 18 месяцев из-за выхода новых поколений чипов. Экспертный вывод: покупка «железа» в собственность оправдана только при 100% загрузке 24/7. В остальных случаях выгоднее гибридная модель, где критические данные остаются внутри, а пиковые нагрузки уходят в облако.

Вывод

Будущее серверного парка — это гибридизация: узкие, сверхмощные GPU-кластеры для обучения и распределенные Edge-узлы для исполнения моделей. Избегайте закупки универсальных серверов «на вырост» — они устареют быстрее, чем вы их настроите. Рекомендую начинать с аудита системы электропитания и охлаждения: если ваша стойка не тянет 20 кВт, покупка GPU-серверов превратится в дорогой обогреватель. Оптимальный путь сегодня — постепенный переход на жидкостное охлаждение и архитектуру с разделением Compute- и Storage-узлов.

VK
Pinterest
Telegram
WhatsApp
OK
Прокрутить вверх