Google DeepMind представила Gemini 3.8 Live и версию с расширенным мышлением
Google DeepMind анонсировала два новых голосовых ИИ-агента: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Компания называет их своими самыми продвинутыми моделями для живого диалога и делает ставку на естественность общения: они выдерживают прерывания, переключаются между языками посреди разговора и параллельно выполняют фоновые задачи, не останавливая беседу.
Две модели под разные задачи
Gemini 3.8 Live позиционируется как решение для масштаба и экономичности. Она обрабатывает визуальный контекст почти в реальном времени, автоматически распознаёт и переключает 97 поддерживаемых языков по ходу диалога, а вызовы инструментов и API выполняет в фоне — модель может подтвердить запрос и продолжить разговор, пока задача завершается. В рейтинге Speech Agent Arena она заняла второе место.
Gemini 3.8 Live Extended Thinking рассчитана на более сложные многошаговые сценарии: она рассуждает и говорит одновременно. Чтобы разговор не повисал в тишине, модель использует реплики вроде «Дайте-ка проверю…» и по ходу дела вслух проговаривает прогресс фоновых операций. По данным компании, она заняла первое место в Speech to Speech Quality Index от Artificial Analysis с оценкой 82,6, набрала 68,6% в бенчмарке τ-Voice, 35,1% в банковском τ-Voice-banking от Sierra и 97,7% в Big Bench Audio.
Где это работает
В демонстрациях модели ведут онбординг сотрудников с опорой на то, что «видит» камера, играют в шахматы, превращают наброски и голосовые комментарии в готовые React-компоненты, а также координируют многошаговые бронирования с асинхронными вызовами функций.
Для разработчиков обе модели уже доступны в Gemini API и Google AI Studio. Для корпоративных клиентов они запускаются в закрытом превью в Gemini Enterprise. Обычные пользователи получат 3.8 Live в Search Live, а 3.8 Live Extended Thinking — в Gemini Live, а также в Docs, Gmail и Keep для подписчиков Google AI. Экосистему голосовых интерфейсов поддерживают платформы Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents; среди партнёров названы Salesforce, Genspark и Lumeris.
Весь звук, сгенерированный этими моделями, помечается незаметным водяным знаком SynthID — по замыслу Google, это должно помочь отличать ИИ-контент и противодействовать дезинформации.
Источник: Google DeepMind
Комментарии
Войдите, чтобы комментировать.