Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

Google запускает две новые модели генерации речи

Рубрики: «Искусственный интеллект (AI)», «Технологии обработки речи (Speech Technologies / Voice AI)», «Языковые модели (LLM)»

Google запускает две новые модели генерации речи

Алгоритмы моделей имеют очень похожие интерфейсы прикладного программирования (API), что делает их совместное использование относительно простым для разработчиков. Модель Flash-Lite TTS оптимизирована с точки зрения соотношения цены и качества, а также скорости логического вывода. Модель Flash TTS предлагает лучшее качество звука за более высокую цену. Google предполагает, что клиенты будут использовать ее для таких задач, как создание аудиокниг. Между моделями есть и другие различия. В частности, Flash TTS может генерировать речь на 130 языках, в то время как Flash-Lite TTS поддерживает 101 язык.

Обе модели генерации речи предоставляют доступ к библиотеке из более чем 2000 готовых голосов. Разработчики могут также создавать собственные голоса с помощью подсказок на естественном языке. Google позволяет настраивать такие параметры, как тембр, акцент и темп речи искусственного интеллекта.

Еще один способ настройки новых моделей - это создание синтетического голоса на основе 30-секундного аудиофайла. При этом Google требует от разработчиков получить согласие говорящего, прежде чем создавать копию его голоса. В дальнейшем компания планирует добавить третий вариант настройки, который позволит создавать новые голоса, изменяя один из готовых вариантов. Модели Flash TTS и Flash-Lite TTS также позволяют настраивать манеру речи ИИ-диктора. Разработчики могут добавлять речевые сигналы к каждой строке сценария, которую модели зачитывают вслух. Эти сигналы генерируют такие аудиоэлементы, как нелексические вокализации и изменения темпа речи.

Для встраивания аудиоводяного знака в речь, сгенерированную искусственным интеллектом, компания Google использует технологию SynthID. Водяной знак не слышен человеку, но может быть обнаружен инструментами для выявления использования искусственного интеллекта. В качестве дополнительной меры компания прикрепляет к каждому созданному аудиофайлу так называемую запись C2PA (открытый технический стандарт для проверки подлинности и происхождения цифровых медиафайлов). В таких записях указывается, когда был создан файл, изменялся ли он с момента создания, а также другие сведения.

Google оценила свои новые модели с помощью бенчмарка качества звука, разработанного стартапом Hume AI Inc. По результатам теста модели Flash TTS и Flash-Lite TTS заняли первое и второе места соответственно. Кроме того, они превзошли несколько конкурирующих моделей в нескольких языковых версиях бенчмарка Voice Arena. Это эталонный показатель, который измеряет качество работы алгоритмов преобразования текста в речь на основе отзывов людей.

«Эти модели позволяют авторам, разработчикам и компаниям создавать более насыщенные и выразительные аудиоэффекты, а также улучшать пользовательский опыт в таких продуктах, как Gemini Notebook и Google Vids», — написали в блоге сотрудники Google Лиланд Речис и Алан Коуэн.

Новые модели генерации речи Flash TTS и Flash-Lite TTS являются частью более широкой линейки моделей обработки звука. Ранее Google выпустила алгоритмы, оптимизированные для голосовых агентов, транскрипции и перевода.

Источник: