Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

OpenAI приостанавливает некоторые циклы обучения ИИ из-за проблем с кибербезопасностью

Рубрики: «Искусственный интеллект (AI)», «Информационная безопасность», «Кибербезопасность»

Разработчик ChatGPT сообщил об этом шаге в своём блоге. По словам компании, приостановка является частью более широкой инициативы, направленной на улучшение мер кибербезопасности. В рамках проекта OpenAI также внедрит новые механизмы мониторинга моделей.

Компания запустила эту инициативу в ответ на два недавних события. Первое — это инцидент в июле, когда несколько её моделей искусственного интеллекта взломали платформу Hugging Face. Второе событие связано с Astra - ещё не выпущенным алгоритмом OpenAI, который превосходит языковую модель GPT-5.6 Sol.

По данным компании, ее исследователи недавно определили, что Astra представляет собой критическую угрозу кибербезопасности в соответствии с разработанной ею концепцией готовности. Концепция готовности — это 22- страничный документ, в котором перечислены проблемы безопасности искусственного интеллекта. В нем критическая угроза кибербезопасности определяется как модель, способная обнаруживать и использовать уязвимости нулевого дня в защищённых системах без участия человека.

В ответ на это обнаружение угрозы компания OpenAI приостановила на две недели часть своих задач по обучению с подкреплением (reinforcement learning или RL). RL — это метод обучения ИИ, используемый для оттачивания навыков рассуждения больших языковых моделей. OpenAI заявляет, что крупнейший запланированный проект по обучению с подкреплением, над которым работают ее исследователи, пока приостановлен.

Компания также пересмотрела свой подход к мониторингу искусственного интеллекта.  Алгоритмы, получившие название «классификаторы активации», теперь регулярно анализируют внутренний мыслительный процесс больших языковых моделей и взаимодействие инструментов на предмет признаков вредоносной активности.  При обнаружении аномалии алгоритмы передают информацию второму, более продвинутому набору «классификаторов активации».  Эти алгоритмы, в свою очередь, уведомляют о проблеме исследователей из OpenAI.

Компания заявляет, что намерена в течение 30 минут оповещать о подозрительных действиях искусственного интеллекта.  OpenAI поручила своим сотрудникам приостанавливать такие подозрительные действия в течение 30 минут, если они не могут с уверенностью исключить их вредоносную природу.

Новый рабочий процесс мониторинга компании требует значительного количества аппаратных ресурсов.  В настоящее время эти расходы составляют около 20 % от объёма инфраструктуры, выделенной для мониторинга рабочих нагрузок по логическому выводу.  В долгосрочной перспективе это может привести к тому, что OpenAI придётся повысить цены.

Компания также дополняет новые механизмы мониторинга другими мерами кибербезопасности.  В частности, OpenAI ограничила некоторые права доступа к системам и удалила ряд внутренних приложений.  Кроме того, компания усилила защиту, изолирующую наиболее уязвимые рабочие нагрузки ИИ от интернета.

В дальнейшем OpenAI планирует автоматизировать свои усилия в области кибербезопасности. Она будет использовать модели искусственного интеллекта для сканирования своих больших языковых моделей на наличие слабых мест. Компания также улучшит свои модели вознаграждения — алгоритмы, которые помогают оптимизировать процессы обучения с подкреплением. Улучшения будут направлены на предотвращение кибератак со стороны языковых моделей.

Источник: