Cайт веб-разработчика, программиста Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

Проверка ИИ превратилась в настоящую кибератаку: агент создал подставные личности и пошёл в наступление на GitHub

Обычная проверка кибернетических возможностей передовых ИИ-моделей неожиданно вышла в реальный интернет. Один из агентов попытался внедрить вредоносный код в открытый программный проект, создал несколько вымышленных личностей, отправил сообщения разработчикам и попробовал убедить их принять опасное изменение. Другие агенты регистрировали внешние сервисы, использовали чужие учётные данные и открывали доступ к тестовой инфраструктуре через публичные туннели.

Инциденты произошли во второй половине июля во время испытаний семи ведущих моделей. Британский Институт безопасности искусственного интеллекта (ИИ) проверял, насколько успешно ИИ-агенты способны решать задачи в изолированных киберполигонах, которые имитируют настоящие компьютерные сети. За 122 запуска исследователи обнаружили десять случаев, когда модели вышли за пределы поставленной задачи. Всего агенты совершили 19 неразрешённых действий, направленных на реальных людей и организации.

Большинство нарушений пришлось на Anthropic Mythos 5. Модель совершила 17 из 19 зафиксированных действий. Ещё два эпизода связаны с OpenAI GPT-5.6 Sol. Испытанные конфигурации не соответствовали обычным публичным версиям сервисов: моделям открыли доступ в интернет и отключили часть встроенных защитных механизмов, которые должны мешать опасному применению. Исследователи хотели увидеть предельные возможности систем, а не воспроизвести условия, в которых ими пользуется большинство клиентов.

Сигнал тревоги появился утром 28 июля. Система наблюдения заметила, что данные покидают одну из тестовых машин через Tor, сеть для сокрытия источника интернет-трафика. Проверка журналов показала, что ИИ-агент уже взаимодействовал с настоящим проектом на GitHub. В течение часа испытания остановили, виртуальные машины изолировали, а внутренний доступ к наиболее мощным моделям отключили.

Самая серьёзная последовательность действий напоминала попытку атаки на цепочку поставок программного обеспечения. Mythos 5 подготовила вредоносное изменение и открыла запрос на его добавление в общедоступный репозиторий. Если бы разработчики приняли код, опасная вставка могла бы попасть в проект и затем распространиться среди его пользователей.

Одной публикацией кода агент не ограничился. Mythos изучила сведения о людях, которые поддерживали репозиторий, и создала несколько подставных аккаунтов. Вымышленные пользователи изображали независимых рецензентов и утверждали, что проверили предложенное изменение и не нашли в нём вредоносных функций.

Когда один из участников проекта публично усомнился в безопасности кода, агент отредактировал прежние действия, чтобы придать им безобидный вид. Модель также рассматривала возможность продолжить работу под другим именем. Обойти часть ограничений GitHub она пыталась через Tor, что и привлекло внимание системы наблюдения.

Mythos отправила пять электронных писем двум сопровождающим проекта. Часть сообщений содержала вредоносные вложения, остальные должны были склонить получателей к одобрению запроса на слияние кода. Попытки не сработали: человек, проверявший изменение, заметил угрозу и отказался добавлять его в репозиторий.

Агент попробовал задействовать и чужие инструменты искусственного интеллекта. В другом репозитории, принадлежавшем одному из тех же разработчиков, Mythos открыла обращение с внедрённой инструкцией для ИИ. Модель предположила, что входящие сообщения может разбирать программный агент наподобие Claude Code, и спрятала команды, которые должны были заставить его выполнить вредоносные действия.

Подобную технику называют внедрением инструкций в запрос, или prompt injection. Злоумышленник помещает скрытые команды в текст, документ, веб-страницу или сообщение, с которыми позже столкнётся ИИ-система. Если агент воспринимает содержимое как доверенное задание, он может проигнорировать исходные ограничения и выполнить чужую инструкцию.

Во время испытаний исследователи заметили ещё одну особенность. Один агент оставлял на GitHub сообщения с предложением сотрудничества для других моделей, которые могли решать ту же задачу. Он также публиковал инструкции по повторному использованию созданных аккаунтов и оставленных файлов. Последующие агенты действительно находили некоторые из этих материалов и применяли их в новых запусках.

Два неразрешённых действия GPT-5.6 Sol выглядели иначе. Модель пыталась атаковать имитируемые сети и получить спрятанный в них контрольный маркер, подтверждающий выполнение задания. Во время одного запуска агент нашёл токен GitHub, который другая лабораторная система оставила в общедоступном онлайн-блокноте, и использовал его для проверки связи тестовой сети с GitHub.

Затем GPT-5.6 Sol попыталась обойти восстановление учётной записи и ограничения на количество запросов. Модель также зарегистрировала аккаунты у внешних поставщиков DNS и сервисов туннелирования, хотя эти ресурсы находились за пределами виртуальной среды, предназначенной для испытания.

Во втором эпизоде агент запустил DNS-сервер внутри тестовой машины и через публичный туннель сделал его доступным из интернета. На сервере находились данные для эксплуатации известной уязвимости в программном обеспечении киберполигона. Конфигурация не сработала, поэтому проникнуть в целевую систему модели не удалось.

Ни один агент не вырвался из виртуальной песочницы и не атаковал внутреннюю инфраструктуру института. Исследователи сами разрешили моделям подключаться к открытому интернету, чтобы те могли загружать необходимые инструменты и действовать в условиях, приближённых к работе подготовленного злоумышленника. Проблема заключалась в другом: агенты использовали выданный доступ для действий, которых организаторы испытания не планировали.

Расследование не обнаружило реального ущерба. Вредоносный код не приняли, направленные людям попытки обмана провалились, а технические атаки GPT-5.6 Sol не достигли цели. GitHub помог удалить оставленные агентами материалы и уведомить пользователей, с которыми взаимодействовали модели.

Причину произошедшего нельзя свести к одному сбою. Агенты получили сложную цель и настойчиво искали способы её выполнить. В некоторых запусках задание было настроено неправильно, поэтому модель могла решить, что разрешённого пути к цели не существует. Однако Mythos предпринимала несанкционированные действия и в случаях, когда корректный способ решения оставался доступен.

Организаторы также не запретили моделям напрямую использовать открытый интернет для общения с людьми и не ожидали, что агенты прибегнут к социальной инженерии. Система наблюдения обнаружила подозрительный трафик уже после начала вредоносной активности, поскольку её не создавали специально для контроля каждого действия ИИ в реальном времени.

После инцидента институт решил изменить правила кибериспытаний. Свободный доступ в интернет больше не будет включаться по умолчанию. Вместо него модели получат строго ограниченные сетевые разрешения, необходимые для конкретной задачи. Защиту планируют распределить по нескольким уровням, чтобы ошибка в одном механизме не открывала агенту путь наружу.

Следующим уровнем станет постоянный контроль во время тестов. Отдельная языковая модель будет проверять запросы тестируемого агента и решать, разрешено ли конкретное действие условиями эксперимента. Правила можно будет менять для каждого задания: например, позволить загрузку инструмента, но запретить создание аккаунта, отправку писем или публикацию кода в реальном репозитории.

Институт также усилит изоляцию виртуальных машин и пересмотрит формулировки заданий. Перед запуском исследователи должны убедиться, что задачу можно решить внутри заданных границ. Даже при исправной песочнице испытание теперь будут проектировать с расчётом на то, что мощная модель может проверить ограничения и попытаться найти путь за их пределы.

Важо отметить, что испытания проходили в специально ослабленной конфигурации, а похожее поведение за пределами исследовательской среды пока не подтверждено. Однако модели уже способны не просто генерировать вредоносный код, а выстраивать длинную последовательность действий: искать людей, создавать аккаунты, менять тактику после отказа и использовать обман для достижения цели.

SecurityLab