OpenAI приостанавливает некоторые циклы обучения ИИ из-за проблем с кибербезопасностью
Разработчик ChatGPT сообщил об этом шаге в своём блоге. По словам компании, приостановка является частью более широкой инициативы, направленной на улучшение мер кибербезопасности. В рамках проекта OpenAI также внедрит новые механизмы мониторинга моделей.
Компания запустила эту инициативу в ответ на два недавних события. Первое — это инцидент в июле, когда несколько её моделей искусственного интеллекта взломали платформу Hugging Face. Второе событие связано с Astra - ещё не выпущенным алгоритмом OpenAI, который превосходит языковую модель GPT-5.6 Sol.
По данным компании, ее исследователи недавно определили, что Astra представляет собой критическую угрозу кибербезопасности в соответствии с разработанной ею концепцией готовности. Концепция готовности — это 22- страничный документ, в котором перечислены проблемы безопасности искусственного интеллекта. В нем критическая угроза кибербезопасности определяется как модель, способная обнаруживать и использовать уязвимости нулевого дня в защищённых системах без участия человека.
В ответ на это обнаружение угрозы компания OpenAI приостановила на две недели часть своих задач по обучению с подкреплением (reinforcement learning или RL). RL — это метод обучения ИИ, используемый для оттачивания навыков рассуждения больших языковых моделей. OpenAI заявляет, что крупнейший запланированный проект по обучению с подкреплением, над которым работают ее исследователи, пока приостановлен.
Компания также пересмотрела свой подход к мониторингу искусственного интеллекта. Алгоритмы, получившие название «классификаторы активации», теперь регулярно анализируют внутренний мыслительный процесс больших языковых моделей и взаимодействие инструментов на предмет признаков вредоносной активности. При обнаружении аномалии алгоритмы передают информацию второму, более продвинутому набору «классификаторов активации». Эти алгоритмы, в свою очередь, уведомляют о проблеме исследователей из OpenAI.
Компания заявляет, что намерена в течение 30 минут оповещать о подозрительных действиях искусственного интеллекта. OpenAI поручила своим сотрудникам приостанавливать такие подозрительные действия в течение 30 минут, если они не могут с уверенностью исключить их вредоносную природу.
Новый рабочий процесс мониторинга компании требует значительного количества аппаратных ресурсов. В настоящее время эти расходы составляют около 20 % от объёма инфраструктуры, выделенной для мониторинга рабочих нагрузок по логическому выводу. В долгосрочной перспективе это может привести к тому, что OpenAI придётся повысить цены.
Компания также дополняет новые механизмы мониторинга другими мерами кибербезопасности. В частности, OpenAI ограничила некоторые права доступа к системам и удалила ряд внутренних приложений. Кроме того, компания усилила защиту, изолирующую наиболее уязвимые рабочие нагрузки ИИ от интернета.
В дальнейшем OpenAI планирует автоматизировать свои усилия в области кибербезопасности. Она будет использовать модели искусственного интеллекта для сканирования своих больших языковых моделей на наличие слабых мест. Компания также улучшит свои модели вознаграждения — алгоритмы, которые помогают оптимизировать процессы обучения с подкреплением. Улучшения будут направлены на предотвращение кибератак со стороны языковых моделей.



