Креативный ИИ / The AI briefing

AWS обеспечивает развёртывание клонирования голоса Qwen3-TTS на SageMaker AI

Пользователи AWS теперь могут развёртывать модель Qwen3-TTS для клонирования голоса в реальном времени через SageMaker, обеспечивая синтез речи с низкой задержкой на десяти различных языках.

Обложка публикации AWS: AWS обеспечивает развёртывание клонирования голоса Qwen3-TTS на SageMaker AI
Из AWS MLОригинальная обложка публикации AWS.

Amazon Web Services добавила модель Qwen3-TTS-12Hz-1.7B-Base в SageMaker JumpStart. Этот релиз позволяет разработчикам развёртывать управляемую конечную точку реального времени для клонирования голоса, которая генерирует речь целевым голосом с использованием короткой эталонной записи без необходимости переобучения базовой модели.

Возможности синтеза речи

Модель Qwen3-TTS, разработанная командой Qwen в Alibaba Cloud, теперь доступна для развёртывания через Amazon SageMaker Python SDK. Система использует специфический речевой токенизатор с частотой дискретизации 12 Гц для поддержки потоковой генерации. Данная архитектура рассчитана на интерактивные сценарии, требующие аудиовывода с низкой задержкой.

Пользователи могут клонировать вокальную идентичность, предоставив короткий аудиоклип и соответствующую ему расшифровку вместе с новым текстом. Модель затем синтезирует новый текст, сохраняя вокальные характеристики эталонного диктора. Этот метод позволяет избежать вычислительных затрат на дообучение или переобучение модели для отдельных голосов.

Развёртывание и языковая поддержка

Базовая модель 1,7 млрд параметров поддерживает десять языков, включая английский, китайский, немецкий и русский. Размещая модель на управляемой инфраструктуре SageMaker, организации могут автоматизировать предоставление и масштабирование GPU, сохраняя аудиоданные в рамках своей конкретной облачной среды. Мониторинг осуществляется через стандартные облачные метрики для помощи в подборе размера конечной точки.

Хотя модель общедоступна, пользователи несут ответственность за настройку конечных точек инференса и управление связанными затратами. Источник описывает путь развёртывания предобученной модели, а не новый архитектурный прорыв в исследованиях синтеза речи.

Первоисточник

В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.

Читать оригинал на AWS ML

← Назад ко всем новостям ИИ