AMD стремится к тому, чтобы ИИ потреблял меньше энергии
В опубликованном на этой неделе сообщении компания AMD подсчитала, что к 2026 году её стоечные системы стали в 4 раза эффективнее, чем в 2024 году. Безусловно, с тех пор многое изменилось. В 2024 году AMD начала серийное производство MI300X - своего первого настоящего графического процессора для центров обработки данных, разработанного для искусственного интеллекта. Этот процессор мощностью 750 Вт имел производительность до 2,6 петафлопс в режиме плотной обработки чисел с плавающей запятой FP8, что на тот момент делало его конкурентоспособным с ускорителям искусственного интеллекта Hopper от Nvidia.
С тех пор AMD задействовала все доступные рычаги, чтобы выжать из своих графических процессоров больше FLOPS на ватт, активнее развивать память и масштабируемые архитектуры, а также оптимизировать свой программный стек, чтобы догнать более крупного и успешного конкурента. Помимо этого, AMD смогла улучшить следующие аспекты:
- добавила поддержку 4-битных типов данных с плавающей запятой,
- интегрировала новые технологии памяти,
- увеличила скорости межсоединений,
- перешла от традиционных серверов с графическими процессорами к полностью интегрированным стоечным системам.
«Самое парадоксальное здесь то, что чем больше устройство, тем оно эффективнее», — заявил в прошлом году изданию El Reg Сэм Наффзигер, старший вице-президент и научный сотрудник AMD.
В прошлом месяце AMD представила результаты своей работы, выпустив вычислительную платформу стоечного масштаба под кодовым названием Helios, которая объединяет 72 графических процессора MI455X в одной массивной системе. По сравнению с MI300X, каждый процессор MI455X имеет:
- в 7,7–15,4 раза большую производительность вычислений с плавающей запятой,
- в 2,25 раза больший объем памяти HBM,
- в 4,4 раза более быструю память,
- в 4 раза большую пропускную способность межчипового соединения.
Безусловно, новый чип быстрее, но он также потребляет более чем в 3 раза больше энергии. Вместо этого наибольший прирост производительности достигается за счёт того, насколько эффективно AMD масштабирует рабочие нагрузки искусственного интеллекта на шести десятках ускорителей системы.
Как обычно, AMD здесь не является первопроходцем. Компания Nvidia совершила переход к стоечным системам в конце 2024 года, выпустив свои системы NVL72 на базе архитектуры Grace Blackwell, которые также объединяют 72 графических процессора в одной стоечной системе. В то время генеральный директор Nvidia Дженсен Хуанг заявлял, что по сравнению с аналогичным количеством графических процессоров Hopper, стойки GB200 NVL72 обеспечивают 4-кратное увеличение производительности обучения и 30-кратное улучшение производительности вывода.
Хотя преимущества архитектур стоечного масштаба очевидны, стоит подчеркнуть, что AMD использует совершенно иную методологию расчёта эффективности, по-разному взвешивая максимальное достигнутое количество операций FLOPS, объем памяти и пропускную способность межсоединений для обучения и вывода, не основывая их сравнение на реальной производительности приложений. Стоит также отметить, что заявленное AMD увеличение в 4 раза является приблизительной оценкой.
Первые экземпляры стоечных систем Helios должны быть отправлены клиентам в этом календарном квартале. Ожидается, что первые результаты тестов на бенчмарках MLPerf и InferenceX появятся вскоре после этого. Однако, если предположить, что AMD сможет выполнить свои планы, то двух стоек Helios будет достаточно для выполнения той же работы, для которой в 2024 году потребовалось бы 570 стоек с оборудованием. Говоря более реалистично, при той же мощности клиенты смогут развернуть в 20 раз больше вычислительных ресурсов.



