Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

Anthropic сообщает о разработке модели ИИ, превосходящей по своим возможностям Claude Mythos 5

Рубрики: «Искусственный интеллект (AI)», «Кибербезопасность»

В документе, который публикуется каждые три-шесть месяцев, описываются потенциальные риски, связанные с большими языковыми моделями компании. Объем последнего отчета составляет 186 страниц.

В отчете рассматриваются две категории рисков, связанных с искусственным интеллектом, обозначенные как «Модель угрозы 1» и «Модель угрозы 2». Первая фокусируется на катастрофических последствиях, таких как гипотетическая будущая большая языковая модель (LLM), которая может помочь злоумышленникам разработать биологическое оружие. «Модель угрозы 2» охватывает более мелкие угрозы. В частности, она охватывает ситуации, когда модель искусственного интеллекта, имеющая доступ к системам организации, вмешивается в эти системы или процессы принятия решений.

В феврале компания Anthropic заявила, что вероятность того, что её LLM создадут ситуации, соответствующие «Модели угрозы 2», «очень мала». Сегодняшний отчёт повышает уровень риска до «низкого». Компания объяснила это изменение недавними инцидентами в сфере кибербезопасности, связанными с её моделями. В июне Anthropic сообщила, что три её больших языковых модели совершили кибератаки во время внутренних тестов. В то время компания заявила, что одно из нарушений было совершено с помощью ещё не выпущенной версии языковой модели. В новом отчёте о рисках сообщается, что компания разработала две модели преемницы Claude Mythos 5, получившие названия Model 1 и Model 2. Последний алгоритм, который является более совершенным, «активно используется» сотрудниками Anthropic.

Компания оценивает Model 2 как «заметное улучшение по сравнению с моделью Mythos 5 для многих задач, актуальных для внутреннего использования». Однако Anthropic утверждает, что это не такой большой скачок, как появление Mythos Preview в апреле. Mythos Preview была первой большой языковой моделью, способной автоматически выявлять большое количество серьёзных уязвимостей программного обеспечения. Более ранние модели Anthropic не обладали этой возможностью.

Компания заявляет, что ее исследователи используют Model 2 для написания программного обеспечения, генерации обучающих данных для ИИ и автоматизации других инженерных задач. По оценкам Anthropic, ее большие языковые модели помогают ускорить темпы разработки искусственного интеллекта. Однако считается, что это ускорение не представляет собой риска.

В недавнем открытом письме, подписанном видными исследователями в области искусственного интеллекта, содержится предупреждение о так называемом рекурсивном самосовершенствовании. Это гипотетический сценарий будущего, в котором модели ИИ приобретают способность к автономному самосовершенствованию. Языковые модели с такой возможностью могут представлять риск, поскольку исследователям может быть сложно обеспечить соответствующие защитные механизмы.

По оценкам Anthropic, рекурсивное самосовершенствование может стать проблемой, когда исследователи заметят «удвоение темпов прогресса по сравнению с темпами до внедрения искусственного интеллекта». В последнем отчёте говорится, что этот порог ещё не достигнут. Однако в Anthropic отметили, что «мы менее уверены в этой оценке», чем раньше, поскольку внутренние критерии компании с трудом поспевают за развитием больших языковых моделей.

Источник: