
AWS валидировала решение с использованием Amazon SageMaker HyperPod и Qumulo Cloud Data Fabric для обучения крупных ИИ-моделей на наборах данных, хранящихся в разных регионах. Архитектура использует предиктивное кэширование для поддержки пропускной способности локального уровня через высоколатентные сетевые каналы, устраняя необходимость в копировании данных петабайтного масштаба между географическими локациями.
Архитектура удалённого доступа к данным
Валидированная конфигурация сочетает управляемую инфраструктуру SageMaker HyperPod с Qumulo Cloud Native и Cloud Data Fabric. Эта настройка позволяет обучающим узлам монтировать локальный спок, который подключается к центральному хабу, содержащему основной набор данных, через VPC peering. Проецируя набор данных в регион вычислений, разработчики могут запускать задания без изменения существующего кода обучения.
Для компенсации сетевой задержки система использует функцию под названием NeuralCache. Этот компонент применяет модель для предсказания конкретных блоков данных размером 4 КБ, требуемых обучающим заданием, с предварительным кэшированием их на удалённой площадке. Этот предиктивный подход направлен на обеспечение работы удалённых наборов данных так, как если бы они хранились на локальном оборудовании.
Тестирование производительности и региональная доступность
AWS протестировала этот подход, запустив идентичные обучающие задания на двух кластерах. Хаб-кластер был размещён в US East (Ohio) рядом с данными, тогда как спок-кластер работал в US West (Oregon) с сетевой задержкой 60 мс. После начального периода разогрева удалённый кластер достиг пропускной способности, идентичной совмещённому хаб-кластеру.
Решение в настоящее время представлено как валидированная архитектура с использованием Amazon SageMaker HyperPod, Amazon EKS и программного обеспечения Qumulo. Хотя оно сохраняло производительность при задержке 60 мс, Qumulo сообщает, что фабрика остаётся функциональной на каналах с задержкой свыше 100 мс. Пользователи должны самостоятельно управлять своими экземплярами Qumulo и VPC peering для реализации данной схемы.
Первоисточник
В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.
Читать оригинал на AWS ML