Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

Google DeepMind представляет серию моделей искусственного интеллекта Gemini Robotics 2

Рубрики: «Искусственный интеллект (AI)», «Робототехника»

Google DeepMind представляет серию моделей искусственного интеллекта Gemini Robotics 2

Компания Google DeepMind утверждает, что серия моделей искусственного интеллекта Gemini Robotics 2 дает возможность нескольким автономным машинам работать совместно над одной задачей. По словам компании, это позволяет автоматизировать работу, состоящую из сотен шагов.

Многие человекоподобные роботы имеют так называемую двухсистемную архитектуру искусственного интеллекта. Это означает, что для выполнения работы они используют две модели искусственного интеллекта. Первая модель, известная как алгоритм воплощённого рассуждения, разрабатывает высокоуровневый план выполнения задачи. Затем модель отправляет этот план так называемой VLA-модели, которая преобразует инструкции в низкоуровневые команды для двигательных механизмов робота. VLA-модель (Vision-Language-Action) — это мультимодальная базовая ИИ-система в робототехнике, которая объединяет зрение, язык и физические действия. Она принимает данные с видеокамер и датчиков и напрямую выдаёт управляющие сигналы для движения моторов робота.

Главная особенность серии моделей Gemini Robotics 2 — это алгоритм воплощённого рассуждения под названием Gemini Robotics ER 2. Этот алгоритм позволяет пользователям описывать на естественном языке задачу, которую должен выполнить человекоподобный робот. По данным Google, ER 2 поддерживает задачи, состоящие из сотен шагов и требующие нескольких минут для выполнения.

Чтобы ускорить выполнение длительной задачи, модель может распределять её между несколькими разными роботами. Кроме того, функция вызова инструментов позволяет ER 2 получать доступ к внешним облачным сервисам. Например, алгоритм может использовать поиск Google для уточнения непонятных частей запроса.

Гуманоидным роботам необходима способность переделывать задачи, которые не удалось выполнить с первой попытки. По данным DeepMind, инженеры компании оснастили ER 2 двумя функциями, которые оптимизируют рабочий процесс:

  1. Первая функция позволяет модели отслеживать ход выполнения задачи, используя видео с камер робота. Если робот совершает ошибку, модель ER 2 может определить последний правильно выполненный машиной шаг и продолжить выполнение задачи с того места, где был выполнен этот шаг. Это избавляет от необходимости переделывать задачи с нуля, что экономит время.
  2. Ещё одна новая функция делает алгоритм ER 2 лучше своего предшественника в определении момента завершения задачи. Чем быстрее искусственный интеллект человекоподобного робота отметит выполнение задачи, тем быстрее он сможет перейти к следующей. Эта возможность также упрощает выполнение некоторых смежных задач, таких как выявление способов исправления ошибок.

«Благодаря непрерывному просмотру видеопотоков с камер роботы теперь могут отслеживать свой собственный прогресс, адаптироваться в случае возникновения проблем и точно знать, когда переходить к следующему шагу», — написали сегодня в своём блоге инженеры Google Стивен Хансен и Пэн Сюй.

После того как алгоритм ER 2 сгенерирует план выполнения задачи, он может отправить инструкции одной из двух других моделей серии Gemini Robotics 2. Это VLA-модели, способные преобразовывать планы действий в низкоуровневые инструкции для робота.

Первая модель известна как Gemini Robotics 2. В отличие от некоторых более ранних моделей, она может управлять не только руками человекоподобного робота, но и всеми его компонентами. В результате алгоритм может оптимизировать центр тяжести робота таким образом, чтобы минимизировать риск падений. Кроме того, Gemini Robotics 2 поддерживает более широкий спектр роботизированных рук, чем более раннее программное обеспечение DeepMind.

Вторая представленная VLA-модель называется Gemini Robotics On-Device 2. Как следует из названия, она предназначена для работы непосредственно на бортовых компьютерах человекоподобных роботов. Компания DeepMind заявляет, что модель может быть адаптирована к новому роботу всего после нескольких часов обучения.

Разработчики могут получить доступ к модели ER 2 через Google Cloud, API Gemini и Google AI Studio. Компания внедряет эту модель одновременно с новым эталоном безопасности использования искусственного интеллекта под названием ASIMOV-Agentic. Этот бенчмарк предназначен для оценки способности человекоподобных роботов избегать столкновений, для управления рисками и разрешения неопределённостей, возникающих в физической робототехнике.

Источник: