Huawei нашла способ разогнать гигантские ИИ-кластеры
Иной ИИ-кластер насчитывает десятки тысяч ускорителей, но выжать из них полную мощность почти нереально. Huawei утверждает: в системе со 100 тыс. NPU реально трудится лишь около 20% вычислительных ресурсов, а всё остальное время железо простаивает в ожидании данных. И чем крупнее модель, тем острее проблема.
Корень зла — обмен данными. Модели с триллионами параметров без конца гоняют туда-сюда промежуточную информацию, а ИИ-агенты вдобавок плодят поток запросов. В итоге скорость упирается уже не столько в процессоры, сколько в то, что их соединяет.
Huawei предлагает архитектуру UnifiedBus. Компания свела вместе больше десяти протоколов и заявляет о росте пропускной способности примерно со 100 Гбайт/с до нескольких Тбайт/с, а задержку RTT обещает срезать с 7 до 2 мкс.
Система связывает CPU, NPU, RAM и SSD напрямую и даёт им единую адресацию памяти внутри SuperPoD. По задумке Huawei, DDR сможет подрабатывать дополнительной памятью для NPU: это ускорит поиск и рекомендации, вдвое поднимет производительность векторного поиска и заодно ослабит зависимость от дорогой HBM.
Для физического соединения внутри стоек Huawei сделала UnifiedBus LinkBlade без кабелей. В конфигурации SuperPoD с 4096 NPU, по данным компании, это экономит около 196 км медных соединений. Между стойками трудится LinkDevice с 176 портами по 1,6 Тбит/с, что в сумме даёт 280 Тбит/с.
Huawei уже показала суперкластер для агентного ИИ на базе SuperPoD TaiShan 950 и Atlas 960, OceanStor M900 и Xinghe UBG. Подтвердятся заявленные цифры на реальных нагрузках — и главным козырем крупных ИИ-систем станет не только число ускорителей, но и умение быстро сводить их ресурсы воедино.
—
Телеграм про право в IT и AI. IT юристы — PravoWeb.com