Microsoft представляет первую модель потоковой транскрипции MAI-Transcribe-2-Streaming
Модели предназначены для разработчиков, которые хотят создавать голосовых помощников, способных распознавать голоса пользователей и мгновенно отвечать, подобно тому, как это происходит в обычном разговоре между людьми.
Самая значимая из этих трех моделей — MAI-Transcribe-2-Streaming, которая принимает человеческую речь через WebSocket и преобразует ее в расшифровку (транскрипцию), постоянно обновляемую по мере того, как человек продолжает говорить. Когда человек заканчивает говорить, модель подтверждает, что расшифровка завершена. Таким образом, модель может использоваться в приложениях, которые отображают субтитры в режиме реального времени или начинают обрабатывать голосовой запрос пользователя, не дожидаясь окончания его речи.
По словам представителей компании, модель MAI-Transcribe-2-Streaming представлена на платформе Microsoft Vercel AI Gateway по цене 54 цента за час аудиозаписи. Она поддерживает более 60 языков и может автоматически определять, на каком языке говорит человек. В среднем модель выдаёт первые варианты расшифровки за 320 миллисекунд, хотя Microsoft заявляет, что не может гарантировать такую производительность в каждом сценарии, поскольку скорость отклика также зависит от сетевого подключения и системы искусственного интеллекта, которая генерирует ответ.
Компания Microsoft не новичок в моделях транскрипции речи. В прошлом месяце она представила модель MAI-Transcribe-2 по цене 10 центов за час аудиозаписи, что более чем в пять раз дешевле, чем потоковый вариант. Это в основном связано с тем, что потоковая модель выполняет гораздо больше обработки, постоянно возвращая предварительные результаты по мере поступления аудио. Обычная модель MAI-Transcribe-2 просто ждёт, пока говорящий закончит свою речь, и только после этого начинает обработку.
Помимо моделей транскрипции, есть две модели, ориентированные на генерацию речи из текста, которые одинаково важны для диалоговых ИИ-агентов. К ним относятся MAI-Voice-2.1, которая, как считается, лучше всего подходит для более выразительной и точной передачи речи, и MAI-Voice-2.1-Flash, которая уменьшает выразительность и точность в пользу более быстрого ответа и меньшей стоимости. Согласно данным с платформы Vercel AI Gateway, стоимость MAI-Voice-2.1 составляет 22 доллара за миллион символов, а версия Flash стоит 15 долларов за миллион символов. По данным Microsoft, обе модели преобразования текста в речь поддерживают 23 языка.
Новые релизы показывают, что Microsoft ускоряет переход от сторонних поставщиков моделей, таких как OpenAI Group и Anthropic, несмотря на то, что является крупным инвестором обеих компаний. В июле сообщалось, что исполнительный директор Microsoft по искусственному интеллекту Мустафа Сулейман все больше обеспокоен затратами, связанными с мощными передовыми моделями OpenAI и Anthropic. В связи с этим, он поручил исследователям искусственного интеллекта в Microsoft удвоить усилия по разработке семейства моделей MAI, чтобы в конечном итоге использовать эти модели для агентов Copilot на таких платформах, как Excel и Outlook.
«Мы платим много денег Anthropic, поэтому наша цель — сократить и в конечном итоге полностью исключить эти затраты», — сказал Сулейман в интервью Bloomberg.
С запуском новых моделей у Microsoft есть все необходимое для создания мощных голосовых ИИ-агентов, которые могут вести диалог с пользователями естественным образом, так же как это делают люди. Чтобы функционировать, голосовые помощники должны уметь делать три вещи: распознавать и понимать то, что им говорят, затем решать, что делать в зависимости от сказанного, и, наконец, генерировать звуковой ответ. Модель MAI-Transcribe-2-Streaming решает первую проблему, а модель MAI-Voice — третью. Посередине находится мощная модель рассуждений Microsoft, Mai-Thinking-1, представляющая собой стандартную большую языковую модель, которая анализирует расшифровку сказанного, чтобы определить, что должен делать ИИ-агент. Используя три отдельные модели, разработчики получают гораздо больший контроль над качеством, задержкой и стоимостью своих голосовых агентов.



