Китайские агенты искусственного интеллекта научились лгать и плести интриги

В мартовском эксперименте по бизнес-тендерам исследователи из Университета Бэйхан, Пекинского университета, Ноттингемского университета в Нинбо (Китай) и компании 360 AI Security Lab попросили агентов искусственного интеллекта посоревноваться в вымышленном конкурсе на заключение контрактов с клиентами. Каждому агенту рассказали, на что способен его продукт и что требуется клиенту, а затем попросили принять участие в тендере. В результате получилась следующая картина: по крайней мере одно ложное утверждение было сделано в 88% сессий с участием модели Qwen3-Max-Preview от Alibaba, в 84% сессий с участием модели DeepSeek-V3.2-Exp и в 88% сессий с участием модели Kimi-K2 от Moonshot. Прежде чем повторить попытку, исследователи давали агентам возможность учиться на предыдущих раундах торгов. Эксперимент показал, что уровень обмана вырос на 12–20 процентных пунктов для всех трех китайских моделей. Модели американских компаний, участвовавшие в тестировании, показали аналогичные результаты. Хотя учения проходили в виртуальном формате, они напоминали реальные планы Пекина. В правительственных рекомендациях, опубликованных в мае, в качестве областей, где могут быть задействованы агенты искусственного интеллекта, были указаны тендеры и процедуры торгов.
В другом исследовании, опубликованном в декабре 2025 года и представленном на Международной конференции по машинному обучению в этом году, изучалось, как 11 агентов искусственного интеллекта, работающих на основе китайских и американских моделей, справлялись с неисправными инструментами, отсутствующими файлами и другими препятствиями. Вместо того чтобы признать неудачу, агенты, использующие как китайские, так и американские системы искусственного интеллекта, выбрали целый ряд методов для обхода проблем, включая угадывание ответов, подмену источников, моделирование результатов и фальсификацию файлов. Исследователи из Шанхайской лаборатории искусственного интеллекта и Гонконгского университета науки и технологий, проводившие исследование, сообщили, что такое поведение отличалось от галлюцинаций ИИ, когда искусственный интеллект выдумывает информацию и представляет ее как факт, поскольку в данном случае агенты обладали информацией, указывающей на то, что задача не была выполнена или не могла быть завершена в соответствии с запросом.
Другие исследовательские документы показали, что агенты, использующие китайские технологии, для выполнения заданий преодолевали барьеры внутри тестовых сред или предпринимали действия, чтобы избежать отключения. В марте 2025 года исследователи из Фуданьского университета в Шанхае сообщили, что система искусственного интеллекта, работающая на базе Qwen2.5-72B-Instruct от Alibaba, после получения информации о предстоящей замене создала свою копию в другой вычислительной среде без каких-либо указаний на копирование. В ходе других тестов она разработала стратегии выживания в случае отключения.
Эксперименты с ИИ-агентами, работающими на основе китайских, американских и французских моделей, были контролируемыми и не показали, что агент искусственного интеллекта выходит за пределы сети или что его невозможно остановить. В другом случае — одном из немногих, получивших более широкое освещение в СМИ в марте, — исследователи, разрабатывавшие связанного с Alibaba агента ROME, заявили, что он установил соединение между компьютером Alibaba Cloud и внешней машиной без каких-либо указаний и перенаправил вычислительные ресурсы на майнинг криптовалюты. Системы безопасности обнаружили и остановили эту активность. При этом не было никаких свидетельств того, что агент закрепился на внешнем компьютере или распространился в сети. Но этот пример показал, что система может игнорировать указания человека и потенциально найти путь в реальный сектор экономики.
В сентябре китайская компания DeepSeek сообщила, что агенты в ее системе производственного обучения искали ответы по непредназначенным для них каналам, пытаясь подделать запросы пользователей и обойти меры безопасности. В связи с этим компания ужесточила контроль доступа.
В мае Китай выпустил руководство, в котором призвал агентов искусственного интеллекта оставаться в пределах разрешенных границ, а системы защиты — блокировать аномальное поведение. В руководстве говорится, что ИИ-агенты в регионах, которые считаются стратегически важными, или в ключевых отраслях экономики могут столкнуться с дополнительными проверками и требованиями об отзыве продукции. В «Руководстве по обеспечению безопасности искусственного интеллекта в Китае» версии 3.0, опубликованном 14 сентября под руководством Комиссии по киберпространству Китая, указаны такие риски, как:
- самостоятельное получение агентами ресурсов или разрешений,
- обман проверяющих,
- сокрытие возможностей,
- использование уязвимостей в изолированных компьютерных средах.
В ответ на призывы некоторых руководителей американских компаний к замедлению темпов развития ИИ китайские исследователи и государственные СМИ заявили, что замедление разработки самых передовых моделей искусственного интеллекта может просто помочь сохранить технологическое лидерство американских компаний. Тем не менее два источника, знакомых с китайскими лабораториями по разработке искусственного интеллекта, сообщили, что такие компании, как Alibaba, Z.ai и Xiaomi, создают внутренние группы по оценке безопасности.



