Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

OpenAI предоставляет разработчикам голосовую модель ИИ, которая может одновременно говорить и слушать

Рубрики: «Искусственный интеллект (AI)», «Технологии обработки речи (Speech Technologies / Voice AI)»

OpenAI предоставляет разработчикам голосовую модель ИИ, которая может одновременно говорить и слушать

Компания OpenAI выпустила версию своей новейшей полнодуплексной голосовой модели реального времени в виде интерфейса прикладного программирования (API), что позволяет разработчикам программного обеспечения создавать более гибкие приложения с поддержкой голосового управления, а также рабочие процессы на основе диалогов.

Модель GPT-Live-1 дебютировал в июле, предлагая взаимодействие посредством устных вопросов и ответов вместо печатного текста. Если первоначально голосовая модель работала только через интерфейс ChatGPT, то теперь она доступна также через API вызовы.

Являясь полнодуплексной моделью, GPT-Live-1 может одновременно слушать и генерировать речь, что способствует более быстрой коммуникации. В общении люди часто говорят одновременно, перебивая друг друга, и им может быть неприятно говорить и слушать по очереди, как если бы они использовали полудуплексные портативные радиостанции. Исследователи из OpenAI говорят, что они сосредоточились на том, чтобы позволить разработчикам, внедряющим GPT-Live-1, настраивать то, как пользователи бизнес-приложений взаимодействуют с помощью голоса и связанных с ними рабочих процессов.

«Одно из ключевых преимуществ GPT-Live-1 — плавная обработка прерываний — уже приносит ощутимые результаты для бизнеса: в ходе первых оценок компания по обучению иностранным языкам Speak обнаружила, что GPT-Live-1 даёт учащимся больше времени на обдумывание, прежде чем им ответит учитель, что сокращает количество прерываний почти на 80 процентов по сравнению с предыдущими системами пошагового обучения», — заявили в OpenAI.

Голосовая модель GPT-Live-1 предназначена для обработки устной речи, в то время как серверные бэкэнд-модели (например, GPT-6 Astra или более доступный вариант GPT для выполнения менее сложных задач) отвечают за поиск информации, использование инструментов и управление задачами.

Это значительный шаг вперед по сравнению с API Realtime от OpenAI, который дебютировал в 2024 году. В бенчмарке Tau3, оценивающем задачи голосового обслуживания клиентов, актуальные для авиакомпаний, розничных продавцов и телекоммуникационных компаний, модель GPT-Live-1 набрала 86,2% правильных ответов, в то время как модель GPT-Realtime-2.1 набрала лишь 45,7%, а GPT-Realtime-2 вообще только 42,4%. Ссылаясь на собственные оценки, OpenAI заявила, что в тесте Full Duplex Bench новая модель GPT-Live-1 демонстрирует на 30 процентов лучшие результаты, чем GPT-Realtime-2.1. Модель GPT-Live-1 также превосходит своего предшественника по задержке при пошаговом обмене сообщениями и интерактивному поведению.

Американская многонациональная компания Yelp, которая управляет популярной онлайн-платформой, связывающей потребителей с местными предприятиями, начала использовать GPT-Live-1 для своего сервиса Yelp Host и положительно отозвалась о технологии с использованием искусственного интеллекта в контексте своей системы бронирования столиков в ресторанах.

«Благодаря GPT-Live-1 каждый звонок становится более интерактивным и оперативным», — заявил Ахил Кудувалли Рамеш, директор по продуктам Yelp. «Yelp Host теперь предоставляет ресторанам передовой голосовой искусственный интеллект, который обеспечивает исключительное качество обслуживания гостей, позволяет использовать возможности получения дохода, которые они могли бы упустить, и помогает персоналу сосредоточиться на обслуживании, а не на ответах на телефонные звонки».

При этом в Yelp не рассматривается вопрос о том, приветствуют ли клиенты ресторанов, делающие заказ, непринуждённые шутки роботов или просто принимают их, потому что это лучше, чем ждать на линии, чтобы пообщаться с человеком.

Стоимость GPT-Live-1 составляет 0,05 доллара за минуту, независимо от используемой серверной модели. Возможность выбора индивидуального голоса может быть согласована с OpenAI. Эта голосовая модель также доступна через OpenAI Presence - платформу корпоративного агентного ИИ компании OpenAI.

Источник: