0
Keysight KAI Data Center Builder — программное решение для эмуляции AI-нагрузок дата-центров

Keysight KAI Data Center Builder — программное решение для эмуляции AI-нагрузок дата-центров

Keysight KAI Data Center Builder предназначен для эмуляции AI-нагрузок и оценки производительности инфраструктуры ЦОД до её развертывания. Решение моделирует RDMA/RoCEv2-трафик, коллективные операции AllReduce, AllGather, ReduceScatter и AlltoAll, эмулирует многопроцессорные GPU-среды и позволяет анализировать пропускную способность, задержки, перегрузки и влияние топологии сети.
Тип:Программная платформа для моделирования и тестирования инфраструктуры AI/ML-центров обработки данных
Поддерживаемые платформы:AresONE-S 400GE, AresONE-M 800GE, серверы с RDMA NIC и реальные AI-ускорители
Интерфейс:100/200/400/800GE Ethernet; RDMA, RoCEv2
Запрос
Итоговая стоимость формируется после выбора конфигурации. Менеджер подберёт оптимальный вариант и назовёт точную цену.
Keysight KAI Data Center Builder предназначен для эмуляции AI-нагрузок и оценки производительности инфраструктуры ЦОД до её развертывания. Решение моделирует RDMA/RoCEv2-трафик, коллективные операции AllReduce, AllGather, ReduceScatter и AlltoAll, эмулирует многопроцессорные GPU-среды и позволяет анализировать пропускную способность, задержки, перегрузки и влияние топологии сети.
Тип:Программная платформа для моделирования и тестирования инфраструктуры AI/ML-центров обработки данных
Поддерживаемые платформы:AresONE-S 400GE, AresONE-M 800GE, серверы с RDMA NIC и реальные AI-ускорители
Интерфейс:100/200/400/800GE Ethernet; RDMA, RoCEv2
Модели

ТЕХНИЧЕСКОЕ ОПИСАНИЕ

Keysight AI Data Center Builder

Оценка и бенчмаркинг инфраструктуры AI / ML

Введение

Бенчмаркинг фабрики кластеров искусственного интеллекта (AI) и машинного обучения (ML) с реалистичными рабочими нагрузками обычно требует значительных инвестиций в вычислительные системы, такие как графические процессоры (GPU) и сетевые интерфейсные карты с удалённым прямым доступом к памяти (RDMA NIC). Эти системы не только дороги, но и требуют значительного времени на создание и эксплуатацию. Проблема заключается не только в финансовых затратах, но и в сложности обслуживания столь развитой инфраструктуры.

В этом техническом обзоре показано, как Keysight AI (KAI) Data Center Builder решает эти задачи, ускоряя циклы инноваций в сетях AI / ML и системах ввода-вывода. Программное решение использует высокоплотные генераторы нагрузки с портами 100–800GE для эмуляции AI-хостов и реалистичных шаблонов трафика AI / ML. KAI Data Center Builder помогает ускорить выпуск решений, снизить затраты, упростить настройку и обслуживание и повысить общую производительность.

Задачи

Для бенчмаркинга фабрики AI- и ML-кластеров с реалистичными рабочими нагрузками требуется комплексное решение, снижающее как стоимость, так и сложность. Ключевые компоненты такого решения:

Реалистичная эмуляция: воспроизведение крупномасштабных AI-нагрузок с измеримой точностью и глубоким анализом производительности коллективных коммуникаций.
Упрощённый бенчмаркинг: готовые приложения бенчмаркинга для более простой проверки AI-сетевой фабрики.
Гибкие тестовые движки: возможность выбирать аппаратные генераторы нагрузки, программные конечные точки или реальные AI-ускорители и сравнивать результаты бенчмаркинга.
Автоматизированные методики тестирования: квалификация эффективности AI-сетевой фабрики по времени завершения задания, изоляции производительности, балансировке нагрузки и механизмам управления перегрузкой.

Решение: KAI Data Center Builder

Keysight AI Data Center Builder (KAI DC Builder) — решение для оценки и бенчмаркинга, оптимизирующее проектирование систем AI / ML. Оно быстрее развёртывается и эксплуатируется, обеспечивает более глубокий анализ и более высокую точность измерений для каждого потока. На рисунке 1 показаны различные уровни центра обработки данных, на которых KAI DC Builder воспроизводит поведение AI-нагрузки.

Рисунок 1. KAI DC Builder работает на нескольких уровнях, воспроизводя поведение AI-нагрузки

KAI DC Builder позволяет размещать и запускать приложения, специализирующиеся на измерении или анализе различных аспектов AI-инфраструктуры. Это даёт подробное представление о производительности, помогает выявлять узкие места и оптимизировать общую эффективность AI-систем.

Роль приложений заключается в сборе набора данных путём выполнения конкретного испытания. Например, одно приложение может измерять пропускную способность передачи данных, а другое — анализировать использование фабрики. Каждое приложение определяет цель испытания, инициализирует его собственной конфигурацией и формирует результаты на основе собранного набора данных. С приложениями KAI DC Builder можно работать через веб-интерфейс в визуальном интерактивном режиме или использовать сценарии автоматизации для пакетного выполнения из автоматизированного конвейера непрерывной интеграции.

KAI DC Builder включает два приложения, существенно повышающих производительность и эффективность AI-инфраструктуры:

KAI Collective Benchmarks выполняет микробенчмаркинг производительности алгоритмов распределённых коммуникаций, обычно используемых в масштабируемых AI-системах и называемых коллективными коммуникациями. Типичная цель приложения Collective Benchmarks — проверить, что сеть обеспечивает оптимальную и стабильную пропускную способность для диапазона обменов данными, характерных для распределённых AI-задач.

KAI Workload Emulation воспроизводит короткие последовательности шагов, через которые реальные AI-нагрузки — например, до или после обучения — проходят тысячи и миллионы итераций, называемых эпохами. Эти нагрузки представляют собой сочетание вычислительных и коммуникационных шагов, главным образом определяемых схемой разделения AI-модели для распределения задачи между сотнями или тысячами GPU. Приложение Workload Emulation позволяет экспериментировать с производительностью выбранных схем разделения модели на различных сетевых топологиях и находить оптимальную комбинацию, уменьшающую время передачи данных и отдающую приоритет вычислениям на GPU, что в итоге сокращает Job Completion Time (JCT).

Комбинация этих двух приложений формирует более целостную и автоматизированную тестовую среду, снижая сложность и время настройки и анализа. Пользователи получают более точные данные и могут эффективнее оптимизировать AI-системы.

Рисунок 2. Приложения KAI Data Center Builder

Тестовые движки KAI

Приложения KAI могут выполнять испытания с использованием одного из тестовых движков KAI:

Аппаратное обеспечение Keysight AresONE управляет высокоплотной нагрузкой трафика с эмуляцией RoCEv2 для точного воспроизведения шаблонов коммуникаций AI/ML в крупном масштабе через тестируемую фабрику. RoCEv2 — транспортный протокол Remote Direct Memory Access (RDMA) over Ethernet, используемый узлами AI-кластера для коллективных коммуникаций.

Программные конечные точки Keysight работают на серверах общего назначения с RDMA NIC, но без GPU, что позволяет включить сетевые карты и их конфигурацию в состав тестируемой системы.

Рисунок 3. Варианты тестовых движков KAI — аппаратные платформы AresONE и программные конечные точки

AresONE-S 400GE

AresONE-M 800GE

KAI Collective Benchmarks

Приложение Keysight Collective Benchmark может выполнять микробенчмаркинг типичных алгоритмов AI-коммуникаций на предоставленной пользователем AI-сетевой фабрике, как показано на рисунке 4. Производительность фабрики можно измерять и улучшать её конструкцию в лабораторной или промежуточной среде без подключения AI-вычислительных узлов с GPU-ускорителями к тестируемой фабрике — с помощью эмуляции трафика RoCEv2 на аппаратуре AresONE.

Рисунок 4. Рабочий процесс приложения KAI Collective Benchmarks с аппаратурой AresONE

Параметры конфигурации

Конфигурацию испытания KAI Collective Benchmarks можно параметризовать в соответствии с размером и свойствами AI-коллектива, на котором выполняется бенчмарк, а также профилем AI-нагрузки, эмулируемой генераторами трафика.

ПараметрЗначенияОписание
Конфигурация логического кластера• Количество GPU
• GPU на вычислительный узел
• Межсоединение NPU
Описывает конфигурацию AI-системы для эмуляции рабочей нагрузки
Коллективная операция: тип• AlltoAll
• AllReduce
• AllGather
• ReduceScatter
• Gather
• Broadcast
Тип коллективной операции
Коллективная операция: алгоритм• Parallel
• Unidirectional Ring
• Bidirectional Ring
• Halving-Double
Алгоритмы коллективной операции; применимость алгоритмов зависит от типа операции
Предустановка рабочей нагрузки: размер данных• Начальное значение
• Шаг итерации
• Конечное значение
Диапазон размеров данных для выполнения бенчмаркинга
Предустановка рабочей нагрузки: транспортный профиль• Транспортный протокол
• Количество Q-Pairs на пару рангов
• Размер RDMA-сообщения
Характеристики транспортного профиля; используются для тонкой настройки на уровне Q-Pair
Предустановка инфраструктуры: профиль NIC• Скорость интерфейса NIC
• MTU NIC
• Настройки IP-интерфейса NIC
• Traffic class / значение DSCP
• Параметры PFC
• Параметры DCQCN
Настройка управления перегрузкой и классификации трафика для эмулируемых NIC

Метрики измерений

Приложение KAI Collective Benchmarks формирует результаты измерений в формате, широко используемом специалистами по AI. На основе параметров AI-коллектива и рабочей нагрузки оно собирает набор метрик и представляет их в табличном виде. Каждая строка содержит измерения для конкретного размера данных, которым должен обмениваться коллектив. Как показано на рисунке 5, при последовательном переборе настраиваемого диапазона размеров данных приложение оценивает производительность AI-фабрики по комбинации ключевых показателей, характерных для коллективных коммуникаций — времени завершения, пропускной способности алгоритма и шины — а также предоставляет дополнительную статистику распределения по отдельным очередям RoCEv2 Q-Pair.

Рисунок 5. Пример метрик измерения

Рисунок 6. Пример сводного отчёта испытания KAI Collective Benchmarks

KAI Workload Emulation

Операторы AI используют различные стратегии параллелизма, также называемые разделением модели, чтобы ускорить обучение AI-моделей. Практические результаты показывают, что согласование схемы разделения с топологией и конфигурацией AI-кластера обеспечивает выдающуюся производительность обучения. На этапе проектирования AI-кластера на критические вопросы лучше всего отвечать экспериментально. Многие из них связаны с эффективностью перемещения данных между графическими процессорами (GPU), например:

Проектирование scale-up межсоединений GPU внутри AI-хоста или стойки.
Проектирование scale-out сети, включая полосу пропускания на GPU и топологию.
Настройка балансировки сетевой нагрузки и управления перегрузкой.
Настройка параметров среды обучения для оптимизации производительности и эффективности.

Приложение KAI Workload Emulation воспроизводит шаблоны сетевых коммуникаций реальных задач обучения AI. Его цели — ускорить эксперименты, сократить время освоения и предоставить более глубокое понимание причин наблюдаемого ухудшения производительности. Такие сведения было бы значительно сложнее получить при использовании реального задания обучения AI.

Запуск KAI Workload Emulation в KAI DC Builder позволяет:

Экспериментировать с параметрами разделения модели и планированием рангов в AI-инфраструктуре.
Понимать вклад коммуникаций внутри разделов и между ними в общее время завершения задания (JCT).
Выявлять типы коллективных операций с низкой производительностью и выполнять детальный анализ для поиска узких мест.
Анализировать использование сети, tail latency, перегрузку и её влияние на JCT.

Библиотека рабочих нагрузок

KAI DC Builder включает библиотеку AI-нагрузок — от классификации изображений до больших языковых моделей (LLM), таких как Llama. Она содержит популярные схемы разделения модели, включая data parallel (DP), fully sharded data parallel (FSDP) и трёхмерный (3D) параллелизм.

Собственные трассы выполнения рабочих нагрузок можно импортировать в библиотеку в формате MLCommons Chakra.

На рисунке 7 показаны рабочие нагрузки в библиотеке, подготовленной Keysight, с подробными метаданными среды и ключевых гиперпараметров, использованных при записи трасс выполнения. Библиотека позволяет исследовать поведение нагрузок и понимать типы и временные характеристики коллективных операций, а также вычислений.

Рисунок 7. Библиотека рабочих нагрузок KAI Data Center Builder

Каждая рабочая нагрузка может содержать трассы, собранные с каждого отдельного ранга (NPU), фиксирующие шаги, которые задание выполняло на этом вычислительном узле, как показано на рисунке 8. За исключением простейших случаев, таких как DDP, поведение разных рангов может различаться в зависимости от их положения в разделе.

Рисунок 8. Подробности рабочей нагрузки для временной шкалы длительности коллективных операций

Параметры конфигурации

После выбора трасс рабочих нагрузок из библиотеки пользователь назначает их набору эмулируемых NPU (рангов) для воспроизведения. Как и в приложении KAI Collective Benchmarking, конфигурация содержит раздел, определяющий логическую структуру кластера: количество AI-хостов, количество NPU на хост и наличие межсоединений NPU. В тестовом стенде должно быть достаточно ресурсов эмуляции — аппаратных тестовых портов или RDMA NIC — для поддержки количества элементов, заданного в разделе логической инфраструктуры, как показано на рисунках 9, 10 и 11.

Рисунок 9. Планирование рабочих нагрузок

Рисунок 10. Моделирование AI-инфраструктуры: восемь стоек, 16 AI-хостов и восемь GPU

Рисунок 11. Параметризация коллективных операций

Метрики измерений

После выполнения испытания Workload Emulation приложение сообщает общее время завершения для каждой трассы рабочей нагрузки, суммируя время по всем рангам, на которых она была запланирована. Кроме того, оно показывает производительность каждой коллективной операции для всех нагрузок в испытании, включая характеристики операции, время завершения, относительное время начала и сведения о разделе модели, как показано в таблице 1.

Таблица 1. Сводка измерений эмуляции рабочей нагрузки

#Workload IDCollective IDРазмер данных (GB)CCT (с)РангиСтарт (с)PP GroupTP GroupDP Group
1LLM_3DP_1AllGather_10.1250.3283.56-1-
2LLM_3DP_1AllGather_20.1250.2984.12-2-
3LLM_3DP_1AllReduce_12.01.34165.43--1

Итоги

Keysight AI Data Center Builder сочетает высокоточную эмуляцию AI-нагрузок, готовые приложения бенчмаркинга и инструменты анализа наборов данных, существенно повышая эффективность оценки производительности сетевой фабрики AI / ML-кластера.

Для ускорения проектирования сетей AI / ML Keysight AI Data Center Builder:

Эмулирует крупномасштабные AI-нагрузки с измеримой точностью — предоставляет глубокое понимание производительности коллективных коммуникаций.
Упрощает процесс бенчмаркинга — позволяет проверять AI-сетевую фабрику с помощью готовых приложений бенчмаркинга, созданных в сотрудничестве с крупнейшими AI-операторами и поставщиками AI-инфраструктуры.
Выполняет определённые модели поведения AI/ML — позволяет обмениваться ими между пользователями и заказчиками для воспроизведения экспериментов.
Предлагает выбор тестовых движков — между эмуляцией конечных точек RoCEv2 на высокоплотных генераторах нагрузки AresONE и программными конечными точками на реальных AI-ускорителях для сравнения результатов бенчмаркинга.

KAI DC Builder обеспечивает крупномасштабную проверку и эксперименты с проектированием фабрики с использованием тестового оборудования AresONE-S 400GE и AresONE-M 800GE реалистично и экономически эффективно. Решение дополняет использование GPU для тестирования нагрузок AI / ML, позволяя AI-операторам сократить расходы, которые в противном случае полностью направлялись бы на GPU-системы бенчмаркинга, и использовать более масштабируемый, надёжный и интегрированный Keysight AI Data Center Builder.

Название

Значение

Тип

Программная платформа для моделирования и тестирования инфраструктуры AI/ML-центров обработки данных

Поддерживаемые платформы

AresONE-S 400GE, AresONE-M 800GE, серверы с RDMA NIC и реальные AI-ускорители

Интерфейс

100/200/400/800GE Ethernet; RDMA, RoCEv2

Особенности

Эмуляция AI-нагрузок и многопроцессорных GPU-систем, Collective Benchmarks и Workload Emulation, тестирование AllReduce, AllGather, ReduceScatter, AlltoAll, Broadcast и Gather, анализ пропускной способности, перегрузок и Job Completion Time, визуализация потоков данных и выявление узких мест сети

Возможность автоматизации с помощью собственного ПО: интеграция, автоматизация измерений, собственные база данных и VISA-мост.

СПОАИ — специальное программное обеспечение для автоматизации измерений, разработанное на мощностях "Акметрон" — отечественного разработчика программного обеспечения, производителя и крупнейшего поставщика оборудования с 2012 года.

Это клиент-серверное приложение с многопользовательской распределённой архитектурой, которое решает задачи повышения производительности труда на производстве, сокращения длительности измерений и снижения требований к квалификации персонала. ПО внесено в реестр Минцифры: №28145

Ключевые преимущества:

  • Полный цикл «под ключ»: от разработки до сопровождения
  • Клиент-серверная архитектура с самостоятельной переналадкой
  • Централизованный сбор и хранение результатов в БД с возможностью миграции в вашу БД
  • Генератор отчетов на основе ваших шаблонов (docx. и xlsx.)
  • Управление приборами с любым типом интерфейса
  • ПО работает на системах Windows, Linux, MacOS, доступна веб-версия

Результаты внедрений:

  • Непрерывная работа в автоматическом режиме до 48 часов
  • До 4 500 измерений за этап
  • Одновременное управление 15+ приборами
  • Автоматизация техтренировки и полной программы испытаний выпускаемых изделий — более 10 контролируемых приборов на одном рабочем месте, до 4 500 автоматизированных измерений в каждом этапе, непрерывная работа в автоматическом режиме 24–48 часов
  • Измерение радиотехнических характеристик приемопередающих модулей
  • Автоматизация тестирования фотонных интегральных схем
  • Контроль и испытания СВЧ-усилителей для космических аппаратов

Для каждого продукта мы предоставляем полный комплект документации: инструкция по установке с пошаговой настройкой, руководство по эксплуатации с описанием требований и рабочих процессов, презентация с обзором возможностей и кейсов внедрения.

Предоставим систему с учётом требований промышленных стандартов и рассчитанную на многолетнюю эксплуатацию. Также мы обеспечиваем соответствие отраслевым требованиям, надёжность архитектуры для критических систем и масштабируемость без потери стабильности.

Наши специалисты помогут вам решить самые сложные задачи по автоматизации, измерениям и интеграции

Рекомендуем посмотреть

rocev2-img
Keysight IXIA IxNetwork RoCEv2— программное решение для тестирования RoCEv2
Программно-аппаратное решение для функционального и нагрузочного тестирования RoCEv2-сетей и lossless Ethernet-инфраструктуры AI/ML Тип
AresONE-S 400GE QSFP-DD 8/16-Port и AresONE-M 800GE QSFP-DD800 4/8-Port Поддерживаемые платформы
RoCEv2-трафик 100GE NRZ, 100GE PAM4 и 200GE PAM4 Интерфейс
keysight-ai-fabric-rocev2-test-solution-img
Keysight IXIA AI Fabric Test Solution — решение для тестирования AI-фабрик RoCEv2
Программно-аппаратное решение для функционального и нагрузочного тестирования lossless Ethernet-фабрик AI/ML Тип
AresONE-S 400GE, AresONE-M 800GE Поддерживаемые платформы
100/200/400/800GE Ethernet; 100GE NRZ и 100/200/400/800GE PAM4 Интерфейс
aresone-s-400ge-qsfp-dd-high-density-16-port-test-system-img
Keysight IXIA AresONE-S 400GE QSFP-DD — 16-портовая тестовая система высокой плотности
Фиксированная тестовая система 2U для функционального, нагрузочного и протокольного тестирования Ethernet L1–L3 Тип
16 × QSFP-DD; 10/25/40/50/100/200/400GE; PAM4 и NRZ; до 6,4 Тбит/с трафика на линейной скорости Интерфейс
IxNetwork, IxExplorer, IxOS Программное обеспечение
keysight-aresone-800ge-qsfp-dd800-m-4-8-portovye-testovye-sistemy-img
Keysight IXIA AresONE 800GE QSFP-DD800-M — тестовая система Ethernet, 2/4/8 портов
Фиксированная тестовая система для функционального, нагрузочного и протокольного тестирования высокоскоростных Ethernet-сетей L1–L3 Тип
4 или 8 × QSFP-DD800; 100/200/400/800GE; PAM4 и NRZ; до 6,4 Тбит/с совокупной пропускной способности Интерфейс
IxNetwork, IxExplorer, IxOS Программное обеспечение
keysight-aresone-800ge-osfp800-m-img
Keysight IXIA AresONE 800GE OSFP800-M — тестовая система Ethernet, 2/4/8 портов
Фиксированная тестовая система для функционального, нагрузочного и протокольного тестирования Ethernet L1–L3 Тип
4 или 8 × OSFP800; 100/200/400/800GE; breakout 2 × 400GE, 4 × 200GE или 8 × 100GE на порт Интерфейс
Генерация и анализ трафика на полной линейной скорости, PAM4 и NRZ, тестирование PCS/FEC, инъекция и анализ ошибок FEC, высокоточное измерение задержки, поддержка PTP и автоматизация через REST, Python, Tcl и Java API Особенности

Сервисное обслуживание

от 150 000 ₽
Калибровка и диагностика
Калибровка и диагностика
цена по запросу
Ремонт измерительного и испытательного оборудования, запчасти, обновление ПО
Ремонт измерительного и испытательного оборудования, запчасти, обновление ПО
от 100 000 ₽
Измерения, пуско-наладка и обучение
Измерения, пуско-наладка и обучение
цена по запросу
Аренда и Б/У оборудование
Аренда и Б/У оборудование
от 30 000 ₽
Организация поверки и сервисное сопровождение
Организация поверки и сервисное сопровождение
от 150 000 ₽
Углублённая диагностика на предмет соответствия заявленным характеристиками
Углублённая диагностика на предмет соответствия заявленным характеристиками

Мы используем файлы cookie

Мы используем cookie для корректной работы сайта, аналитики и улучшения пользовательского опыта. Подробнее об обработке данных — в Политике конфиденциальности.

Настройка cookie

Технические cookie нужны для стабильной работы. Аналитические и другие cookie помогают нам делать сайт лучше для вас: понимать, что вам интересно, и улучшать навигацию. Эти данные анонимны. Разрешая их, вы вносите свой вклад в развитие нашего сайта. Подробности в Политике обработки персональных данных.

Технические Cookie

Эти файлы cookie необходимы для правильной работы сайта и его основных функций (например, навигация, сохранение сессии, работа форм). Без них сайт не сможет функционировать должным образом. Они не собирают информацию для маркетинга или отслеживания. Этот тип cookie нельзя отключить.

Аналитические/Рекламные cookie

Эти файлы cookie позволяют нам собирать информацию о том, как посетители используют наш сайт (например, какие страницы посещают чаще, сколько времени проводят на сайте, возникают ли ошибки). Эта информация собирается в агрегированном или обезличенном виде и используется для анализа и улучшения работы сайта. Данные обрабатываются Яндекс.Метрикой согласно ее политике конфиденциальности (см. сайт Яндекса). Эти cookie активны только с вашего согласия.

Функциональные (остальные) cookie

Эти файлы cookie позволяют сайту запоминать сделанный вами выбор и предоставлять расширенные функции для вашего удобства. Они также могут использоваться для обеспечения работы встроенных на сайт сервисов (например, видеоплееров от Vimeo, виджетов социальных сетей VK), которые улучшают ваш опыт взаимодействия с сайтом. Эти сервисы могут устанавливать свои cookie для корректной работы и запоминания предпочтений. Эти cookie активны только с вашего согласия.

Настройка