Keysight KAI Data Center Builder — программное решение для эмуляции AI-нагрузок дата-центров
ТЕХНИЧЕСКОЕ ОПИСАНИЕ
Keysight AI Data Center Builder
Оценка и бенчмаркинг инфраструктуры AI / ML
Введение
Бенчмаркинг фабрики кластеров искусственного интеллекта (AI) и машинного обучения (ML) с реалистичными рабочими нагрузками обычно требует значительных инвестиций в вычислительные системы, такие как графические процессоры (GPU) и сетевые интерфейсные карты с удалённым прямым доступом к памяти (RDMA NIC). Эти системы не только дороги, но и требуют значительного времени на создание и эксплуатацию. Проблема заключается не только в финансовых затратах, но и в сложности обслуживания столь развитой инфраструктуры.
В этом техническом обзоре показано, как Keysight AI (KAI) Data Center Builder решает эти задачи, ускоряя циклы инноваций в сетях AI / ML и системах ввода-вывода. Программное решение использует высокоплотные генераторы нагрузки с портами 100–800GE для эмуляции AI-хостов и реалистичных шаблонов трафика AI / ML. KAI Data Center Builder помогает ускорить выпуск решений, снизить затраты, упростить настройку и обслуживание и повысить общую производительность.
Задачи
Для бенчмаркинга фабрики AI- и ML-кластеров с реалистичными рабочими нагрузками требуется комплексное решение, снижающее как стоимость, так и сложность. Ключевые компоненты такого решения:
Решение: KAI Data Center Builder
Keysight AI Data Center Builder (KAI DC Builder) — решение для оценки и бенчмаркинга, оптимизирующее проектирование систем AI / ML. Оно быстрее развёртывается и эксплуатируется, обеспечивает более глубокий анализ и более высокую точность измерений для каждого потока. На рисунке 1 показаны различные уровни центра обработки данных, на которых KAI DC Builder воспроизводит поведение AI-нагрузки.
Рисунок 1. KAI DC Builder работает на нескольких уровнях, воспроизводя поведение AI-нагрузки
KAI DC Builder позволяет размещать и запускать приложения, специализирующиеся на измерении или анализе различных аспектов AI-инфраструктуры. Это даёт подробное представление о производительности, помогает выявлять узкие места и оптимизировать общую эффективность AI-систем.
Роль приложений заключается в сборе набора данных путём выполнения конкретного испытания. Например, одно приложение может измерять пропускную способность передачи данных, а другое — анализировать использование фабрики. Каждое приложение определяет цель испытания, инициализирует его собственной конфигурацией и формирует результаты на основе собранного набора данных. С приложениями KAI DC Builder можно работать через веб-интерфейс в визуальном интерактивном режиме или использовать сценарии автоматизации для пакетного выполнения из автоматизированного конвейера непрерывной интеграции.
KAI DC Builder включает два приложения, существенно повышающих производительность и эффективность AI-инфраструктуры:
KAI Collective Benchmarks выполняет микробенчмаркинг производительности алгоритмов распределённых коммуникаций, обычно используемых в масштабируемых AI-системах и называемых коллективными коммуникациями. Типичная цель приложения Collective Benchmarks — проверить, что сеть обеспечивает оптимальную и стабильную пропускную способность для диапазона обменов данными, характерных для распределённых AI-задач.
KAI Workload Emulation воспроизводит короткие последовательности шагов, через которые реальные AI-нагрузки — например, до или после обучения — проходят тысячи и миллионы итераций, называемых эпохами. Эти нагрузки представляют собой сочетание вычислительных и коммуникационных шагов, главным образом определяемых схемой разделения AI-модели для распределения задачи между сотнями или тысячами GPU. Приложение Workload Emulation позволяет экспериментировать с производительностью выбранных схем разделения модели на различных сетевых топологиях и находить оптимальную комбинацию, уменьшающую время передачи данных и отдающую приоритет вычислениям на GPU, что в итоге сокращает Job Completion Time (JCT).
Комбинация этих двух приложений формирует более целостную и автоматизированную тестовую среду, снижая сложность и время настройки и анализа. Пользователи получают более точные данные и могут эффективнее оптимизировать AI-системы.
Рисунок 2. Приложения KAI Data Center Builder
Тестовые движки KAI
Приложения KAI могут выполнять испытания с использованием одного из тестовых движков KAI:
Аппаратное обеспечение Keysight AresONE управляет высокоплотной нагрузкой трафика с эмуляцией RoCEv2 для точного воспроизведения шаблонов коммуникаций AI/ML в крупном масштабе через тестируемую фабрику. RoCEv2 — транспортный протокол Remote Direct Memory Access (RDMA) over Ethernet, используемый узлами AI-кластера для коллективных коммуникаций.
Программные конечные точки Keysight работают на серверах общего назначения с RDMA NIC, но без GPU, что позволяет включить сетевые карты и их конфигурацию в состав тестируемой системы.
Рисунок 3. Варианты тестовых движков KAI — аппаратные платформы AresONE и программные конечные точки
AresONE-S 400GE
AresONE-M 800GE
KAI Collective Benchmarks
Приложение Keysight Collective Benchmark может выполнять микробенчмаркинг типичных алгоритмов AI-коммуникаций на предоставленной пользователем AI-сетевой фабрике, как показано на рисунке 4. Производительность фабрики можно измерять и улучшать её конструкцию в лабораторной или промежуточной среде без подключения AI-вычислительных узлов с GPU-ускорителями к тестируемой фабрике — с помощью эмуляции трафика RoCEv2 на аппаратуре AresONE.
Рисунок 4. Рабочий процесс приложения KAI Collective Benchmarks с аппаратурой AresONE
Параметры конфигурации
Конфигурацию испытания KAI Collective Benchmarks можно параметризовать в соответствии с размером и свойствами AI-коллектива, на котором выполняется бенчмарк, а также профилем AI-нагрузки, эмулируемой генераторами трафика.
| Параметр | Значения | Описание |
|---|---|---|
| Конфигурация логического кластера | • Количество GPU • GPU на вычислительный узел • Межсоединение NPU | Описывает конфигурацию AI-системы для эмуляции рабочей нагрузки |
| Коллективная операция: тип | • AlltoAll • AllReduce • AllGather • ReduceScatter • Gather • Broadcast | Тип коллективной операции |
| Коллективная операция: алгоритм | • Parallel • Unidirectional Ring • Bidirectional Ring • Halving-Double | Алгоритмы коллективной операции; применимость алгоритмов зависит от типа операции |
| Предустановка рабочей нагрузки: размер данных | • Начальное значение • Шаг итерации • Конечное значение | Диапазон размеров данных для выполнения бенчмаркинга |
| Предустановка рабочей нагрузки: транспортный профиль | • Транспортный протокол • Количество Q-Pairs на пару рангов • Размер RDMA-сообщения | Характеристики транспортного профиля; используются для тонкой настройки на уровне Q-Pair |
| Предустановка инфраструктуры: профиль NIC | • Скорость интерфейса NIC • MTU NIC • Настройки IP-интерфейса NIC • Traffic class / значение DSCP • Параметры PFC • Параметры DCQCN | Настройка управления перегрузкой и классификации трафика для эмулируемых NIC |
Метрики измерений
Приложение KAI Collective Benchmarks формирует результаты измерений в формате, широко используемом специалистами по AI. На основе параметров AI-коллектива и рабочей нагрузки оно собирает набор метрик и представляет их в табличном виде. Каждая строка содержит измерения для конкретного размера данных, которым должен обмениваться коллектив. Как показано на рисунке 5, при последовательном переборе настраиваемого диапазона размеров данных приложение оценивает производительность AI-фабрики по комбинации ключевых показателей, характерных для коллективных коммуникаций — времени завершения, пропускной способности алгоритма и шины — а также предоставляет дополнительную статистику распределения по отдельным очередям RoCEv2 Q-Pair.
Рисунок 5. Пример метрик измерения
Рисунок 6. Пример сводного отчёта испытания KAI Collective Benchmarks
KAI Workload Emulation
Операторы AI используют различные стратегии параллелизма, также называемые разделением модели, чтобы ускорить обучение AI-моделей. Практические результаты показывают, что согласование схемы разделения с топологией и конфигурацией AI-кластера обеспечивает выдающуюся производительность обучения. На этапе проектирования AI-кластера на критические вопросы лучше всего отвечать экспериментально. Многие из них связаны с эффективностью перемещения данных между графическими процессорами (GPU), например:
Приложение KAI Workload Emulation воспроизводит шаблоны сетевых коммуникаций реальных задач обучения AI. Его цели — ускорить эксперименты, сократить время освоения и предоставить более глубокое понимание причин наблюдаемого ухудшения производительности. Такие сведения было бы значительно сложнее получить при использовании реального задания обучения AI.
Запуск KAI Workload Emulation в KAI DC Builder позволяет:
Библиотека рабочих нагрузок
KAI DC Builder включает библиотеку AI-нагрузок — от классификации изображений до больших языковых моделей (LLM), таких как Llama. Она содержит популярные схемы разделения модели, включая data parallel (DP), fully sharded data parallel (FSDP) и трёхмерный (3D) параллелизм.
Собственные трассы выполнения рабочих нагрузок можно импортировать в библиотеку в формате MLCommons Chakra.
На рисунке 7 показаны рабочие нагрузки в библиотеке, подготовленной Keysight, с подробными метаданными среды и ключевых гиперпараметров, использованных при записи трасс выполнения. Библиотека позволяет исследовать поведение нагрузок и понимать типы и временные характеристики коллективных операций, а также вычислений.
Рисунок 7. Библиотека рабочих нагрузок KAI Data Center Builder
Каждая рабочая нагрузка может содержать трассы, собранные с каждого отдельного ранга (NPU), фиксирующие шаги, которые задание выполняло на этом вычислительном узле, как показано на рисунке 8. За исключением простейших случаев, таких как DDP, поведение разных рангов может различаться в зависимости от их положения в разделе.
Рисунок 8. Подробности рабочей нагрузки для временной шкалы длительности коллективных операций
Параметры конфигурации
После выбора трасс рабочих нагрузок из библиотеки пользователь назначает их набору эмулируемых NPU (рангов) для воспроизведения. Как и в приложении KAI Collective Benchmarking, конфигурация содержит раздел, определяющий логическую структуру кластера: количество AI-хостов, количество NPU на хост и наличие межсоединений NPU. В тестовом стенде должно быть достаточно ресурсов эмуляции — аппаратных тестовых портов или RDMA NIC — для поддержки количества элементов, заданного в разделе логической инфраструктуры, как показано на рисунках 9, 10 и 11.
Рисунок 9. Планирование рабочих нагрузок
Рисунок 10. Моделирование AI-инфраструктуры: восемь стоек, 16 AI-хостов и восемь GPU
Рисунок 11. Параметризация коллективных операций
Метрики измерений
После выполнения испытания Workload Emulation приложение сообщает общее время завершения для каждой трассы рабочей нагрузки, суммируя время по всем рангам, на которых она была запланирована. Кроме того, оно показывает производительность каждой коллективной операции для всех нагрузок в испытании, включая характеристики операции, время завершения, относительное время начала и сведения о разделе модели, как показано в таблице 1.
Таблица 1. Сводка измерений эмуляции рабочей нагрузки
| # | Workload ID | Collective ID | Размер данных (GB) | CCT (с) | Ранги | Старт (с) | PP Group | TP Group | DP Group |
|---|---|---|---|---|---|---|---|---|---|
| 1 | LLM_3DP_1 | AllGather_1 | 0.125 | 0.32 | 8 | 3.56 | - | 1 | - |
| 2 | LLM_3DP_1 | AllGather_2 | 0.125 | 0.29 | 8 | 4.12 | - | 2 | - |
| 3 | LLM_3DP_1 | AllReduce_1 | 2.0 | 1.34 | 16 | 5.43 | - | - | 1 |
Итоги
Keysight AI Data Center Builder сочетает высокоточную эмуляцию AI-нагрузок, готовые приложения бенчмаркинга и инструменты анализа наборов данных, существенно повышая эффективность оценки производительности сетевой фабрики AI / ML-кластера.
Для ускорения проектирования сетей AI / ML Keysight AI Data Center Builder:
KAI DC Builder обеспечивает крупномасштабную проверку и эксперименты с проектированием фабрики с использованием тестового оборудования AresONE-S 400GE и AresONE-M 800GE реалистично и экономически эффективно. Решение дополняет использование GPU для тестирования нагрузок AI / ML, позволяя AI-операторам сократить расходы, которые в противном случае полностью направлялись бы на GPU-системы бенчмаркинга, и использовать более масштабируемый, надёжный и интегрированный Keysight AI Data Center Builder.
Возможность автоматизации с помощью собственного ПО: интеграция, автоматизация измерений, собственные база данных и VISA-мост.
СПОАИ — специальное программное обеспечение для автоматизации измерений, разработанное на мощностях "Акметрон" — отечественного разработчика программного обеспечения, производителя и крупнейшего поставщика оборудования с 2012 года.
Это клиент-серверное приложение с многопользовательской распределённой архитектурой, которое решает задачи повышения производительности труда на производстве, сокращения длительности измерений и снижения требований к квалификации персонала. ПО внесено в реестр Минцифры: №28145
Ключевые преимущества:
- Полный цикл «под ключ»: от разработки до сопровождения
- Клиент-серверная архитектура с самостоятельной переналадкой
- Централизованный сбор и хранение результатов в БД с возможностью миграции в вашу БД
- Генератор отчетов на основе ваших шаблонов (docx. и xlsx.)
- Управление приборами с любым типом интерфейса
- ПО работает на системах Windows, Linux, MacOS, доступна веб-версия
Результаты внедрений:
- Непрерывная работа в автоматическом режиме до 48 часов
- До 4 500 измерений за этап
- Одновременное управление 15+ приборами
- Автоматизация техтренировки и полной программы испытаний выпускаемых изделий — более 10 контролируемых приборов на одном рабочем месте, до 4 500 автоматизированных измерений в каждом этапе, непрерывная работа в автоматическом режиме 24–48 часов
- Измерение радиотехнических характеристик приемопередающих модулей
- Автоматизация тестирования фотонных интегральных схем
- Контроль и испытания СВЧ-усилителей для космических аппаратов
Для каждого продукта мы предоставляем полный комплект документации: инструкция по установке с пошаговой настройкой, руководство по эксплуатации с описанием требований и рабочих процессов, презентация с обзором возможностей и кейсов внедрения.
Предоставим систему с учётом требований промышленных стандартов и рассчитанную на многолетнюю эксплуатацию. Также мы обеспечиваем соответствие отраслевым требованиям, надёжность архитектуры для критических систем и масштабируемость без потери стабильности.
Наши специалисты помогут вам решить самые сложные задачи по автоматизации, измерениям и интеграции
Рекомендуем посмотреть
Сервисное обслуживание