Новая речевая модель Google Gemini 3.8 Live поддерживает рассуждения в реальном времени
Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking позиционируются Google как самые передовые модели обработки голоса, выпущенные компанией на сегодняшний день. Они способны к рассуждениям практически в реальном времени, а также к одновременной обработке речи и мыслей. Кроме того, они могут в фоновом режиме выполнять вызовы сторонних программных инструментов.

По сообщениям Google, новые модели демонстрируют первоклассные результаты в тестах: Gemini 3.8 Live Extended Thinking достигла нового рекордного показателя в 82,6 балла в индексе качества преобразования «речи в речь» (Speech-to-Speech) с помощью искусственного интеллекта, превзойдя такие модели, как GPT-Live-1-Astra и Grok Voice Think Fast 2.0. Speech-to-Speech (S2S или StS) — это технология искусственного интеллекта, которая принимает на вход голосовую аудиозапись или живую речь и выдаёт ответ также в виде аудиофайла или синтезированного голоса. Модель Gemini 3.8 Live также заняла второе место в альтернативном тесте Speech Agent Arena и первое место в тесте EVA-Bench от компании ServiceNow Inc. Кроме того, Gemini 3.8 Live Extended Thinking показала результат 68,6% в тесте T-Voice, 35,1% в тесте T-Voice-banking и 97,7% в тесте Big Bench Audio.
Компания Google объяснила, что новые модели разработаны для выполнения вызовов API (интерфейсов прикладного программирования) и инструментов в фоновом режиме, сохраняя при этом естественный темп разговора с пользователями. Это означает, что агенты ИИ могут продолжать общаться в чате, одновременно работая над задачами, которые только что были им поручены. По словам Google, это обеспечивает более естественный, похожий на человеческий, процесс совершения звонков, при котором пользователи не сталкиваются с постоянными прерываниями в работе, когда их агенты обращаются в Интернет в поисках ответов на какие-либо вопросы.
Как заявила Google, эти модели также обладают рядом расширенных функций. Например, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking поддерживают автоматическое определение языка и имеют возможность переключать язык в середине разговора. Они способны понимать и генерировать речь на 97 языках, поддерживают технологию «визуального заземления в режиме реального времени» (Real-time Visual Grounding), а также могут использовать ранние вербальные сигналы, такие как «дай-ка я проверю это», для подтверждения запросов пользователя более естественным и реалистичным способом. Real‑time Visual Grounding — это технология искусственного интеллекта, в которой система в реальном времени сопоставляет текстовые описания с конкретными участками изображения (или кадра видео) и локализует нужный объект.
Google сообщила, что модель Gemini 3.8 Live уже доступна через API Gemini и Google AI Studio, а также в рамках закрытой корпоративной предварительной версии в Gemini Enterprise и Search Live. Что касается модели Gemini 3.8 Live Extended Thinking, она доступна через те же каналы, а также в Google Workspace через Docs, Gmail и Keep (для подписчиков) и в приложениях Gemini Live.
Разработчики также смогут интегрировать модели в свои приложения через партнерские платформы Google, такие как Vercel, Agora, LiveKit, Pipecat, Fishjam и Vision Agents. При генерации аудиофайлов будет добавляться невидимый водяной знак SynthID, который можно использовать для обнаружения дезинформации, добавила Google.
Что касается ценообразования, то стандартная модель Gemini 3.8 Live стоит 0,005 доллара в минуту за аудиовход и 0,018 доллара в минуту за вывод. Модель Extended Thinking также взимает плату за токены рассуждений и за дополнительные входные данные, такие как видео и документы.



