Модели ИИ / Дайджест ИИ

AWS улучшает обучение моделей MoE с помощью EKS и EFA для повышения пропускной способности

AWS повышает эффективность обучения крупных ИИ-моделей за счёт новых оптимизаций архитектуры.

Обложка публикации AWS: AWS улучшает обучение моделей MoE с помощью EKS и EFA для повышения пропускной способности
Из AWS MLОригинальная обложка публикации AWS.

AWS разработала масштабируемую архитектуру с использованием Elastic Kubernetes Service и Elastic Fabric Adapter для решения задач обучения моделей Mixture-of-Experts методами обучения с подкреплением.

Что было объявлено

AWS представила оптимизированную архитектуру для масштабирования моделей Mixture-of-Experts (MoE) при применении методов обучения с подкреплением, таких как обучение с подкреплением на основе обратной связи от человека (RLHF) и Group Relative Policy Optimization (GRPO). Эта новая инфраструктура решает три основные проблемы: координацию гетерогенных вычислительных ресурсов, поддержание высокопропускного сетевого взаимодействия и эффективную оркестрацию подсистем. Сочетание Amazon Elastic Kubernetes Service (EKS) и Elastic Fabric Adapter (EFA) помогает оптимизировать эти процессы.

Модели MoE позволяют масштабировать языковые модели до триллионов параметров без существенных затрат на инференс. Однако процесс обучения остается сложным из-за необходимости интенсивного обмена данными между различными устройствами, особенно на этапе обучения с подкреплением, что предъявляет повышенные требования к инфраструктуре.

Ограничения и доступность

Несмотря на улучшения, сохраняется сложная задача балансирования высоких накладных расходов на коммуникацию, вызванных параллелизмом экспертов (Expert Parallelism), с задачами обучения и инференса. Этим динамическим роутингом токенов необходимо эффективно управлять, чтобы избежать узких мест и гарантировать выполнение всех задач обучения и инференса без простоя вычислительных ресурсов.

Подход AWS все еще находится в области архитектурной оптимизации, и организациям необходимо обеспечить, чтобы их инфраструктура могла эффективно поддерживать такие сложные конвейеры обучения.

Первоисточник

В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.

Читать оригинал на AWS ML

← Назад ко всем новостям ИИ