
Amazon Web Services добавила модель Qwen3-TTS-12Hz-1.7B-Base в SageMaker JumpStart. Этот релиз позволяет разработчикам развёртывать управляемую конечную точку реального времени для клонирования голоса, которая генерирует речь целевым голосом с использованием короткой эталонной записи без необходимости переобучения базовой модели.
Возможности синтеза речи
Модель Qwen3-TTS, разработанная командой Qwen в Alibaba Cloud, теперь доступна для развёртывания через Amazon SageMaker Python SDK. Система использует специфический речевой токенизатор с частотой дискретизации 12 Гц для поддержки потоковой генерации. Данная архитектура рассчитана на интерактивные сценарии, требующие аудиовывода с низкой задержкой.
Пользователи могут клонировать вокальную идентичность, предоставив короткий аудиоклип и соответствующую ему расшифровку вместе с новым текстом. Модель затем синтезирует новый текст, сохраняя вокальные характеристики эталонного диктора. Этот метод позволяет избежать вычислительных затрат на дообучение или переобучение модели для отдельных голосов.
Развёртывание и языковая поддержка
Базовая модель 1,7 млрд параметров поддерживает десять языков, включая английский, китайский, немецкий и русский. Размещая модель на управляемой инфраструктуре SageMaker, организации могут автоматизировать предоставление и масштабирование GPU, сохраняя аудиоданные в рамках своей конкретной облачной среды. Мониторинг осуществляется через стандартные облачные метрики для помощи в подборе размера конечной точки.
Хотя модель общедоступна, пользователи несут ответственность за настройку конечных точек инференса и управление связанными затратами. Источник описывает путь развёртывания предобученной модели, а не новый архитектурный прорыв в исследованиях синтеза речи.
Первоисточник
В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.
Читать оригинал на AWS ML