
Google DeepMind выпустила модели Gemini 3.8 Flash TTS и Flash-Lite TTS, позволяющие авторам генерировать экспрессивные, настраиваемые голоса для таких приложений, как аудиокниги и игры.
Что было объявлено
Google DeepMind представила две новые модели синтеза речи: Gemini 3.8 Flash TTS и Flash-Lite TTS. Эти модели позволяют пользователям создавать полностью настраиваемые голоса с возможностью изменять акцент и эмоциональную окраску. Такой уровень персонализации призван улучшить восприятие аудио в различных сценариях, таких как аудиокниги, видеоигры и подкасты.
Разработчики и авторы контента могут использовать эти модели через такие платформы, как Google AI Studio и Google Vids, что обеспечивает гибкий процесс создания естественно и выразительно звучащего аудио. Инструменты созданы для повышения вовлеченности пользователей, упрощая создание уникальных голосов персонажей и диалогов для сцен.
Ограничения и доступность
Хотя Gemini 3.8 представляет собой значительный шаг вперед в технологиях преобразования текста в речь, к потенциальным ограничениям относится сложность обеспечения этичного использования этих голосов. Реализованные компанией Google функции безопасности призваны предотвратить злоупотребления, однако эффективность этих мер еще предстоит оценить.
Модели входят в растущее семейство Gemini Audio от Google DeepMind и в настоящее время доступны через Gemini API и корпоративные решения, позволяя компаниям применять их для создания индивидуальных аудиорешений.
Первоисточник
В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.
Читать оригинал на Google DeepMind