
Google DeepMind представила Live Avatar для Gemini 3.8 Live, объединяющий сгенерированное видео с речью во время разговора. Функция доступна в Gemini Enterprise и может продолжать диалог, пока инструменты извлекают информацию в фоновом режиме. Google называет клиентскую поддержку и интерактивные инструкции возможными сценариями применения.
Что анонсировала Google
Google DeepMind описывает Gemini 3.8 Live с Live Avatar как систему, которая генерирует диалоговое видео и аудио одновременно. В анонсе подчеркиваются синхронизация губ, мимика и очередность реплик во время голосового общения.
Система может выполнять фоновые вызовы инструментов, пока разговор продолжается. Google использует сценарий заселения в отель, чтобы проиллюстрировать, как аватар может обсуждать задачу, пока подключенные инструменты извлекают или обновляют данные. В анонсе говорится, что доступность начинается в Gemini Enterprise.
Что демонстрирует показ
Наглядный рабочий процесс показывает предполагаемое взаимодействие, но не дает гарантий того, насколько надежно он будет работать в различных компаниях, на разных языках или при нестандартных запросах клиентов. Командам, оценивающим такой интерфейс, по-прежнему потребуется протестировать права доступа инструментов, качество ответов и передачу диалога человеку.
Первоисточник
В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.
Читать оригинал на Google DeepMind