Хакеру больше не придётся сидеть за клавиатурой: OpenAI ждёт постоянных атак искусственного интеллекта
Кибератаки с участием искусственного интеллекта (ИИ) скоро могут перестать быть отдельными операциями и превратиться в непрерывную автоматизированную охоту на уязвимости. В OpenAI считают, что передовые модели уже приближаются к уровню, когда смогут самостоятельно планировать атаки, менять тактику после неудач и часами или даже днями искать путь внутрь защищенных систем. Компания ожидает появления непрерывных атак, которые будут постоянно давить на выбранную инфраструктуру без необходимости вручную управлять каждым шагом.
Директор OpenAI по глобальным вопросам Крис Лихейн считает, что индустрия входит в новый этап развития искусственного интеллекта. Особенно серьезный риск создадут мощные модели с открытыми весами, которые злоумышленники смогут запускать без ограничений разработчиков. Некоторые открытые системы уже отстают от лучших закрытых моделей всего на несколько месяцев.
Лихейн описывает довольно неприятный сценарий. Атакующему больше не придется вручную проверять каждую цель, искать подходящую уязвимость и перестраивать операцию после очередного отказа. Можно запустить множество автономных агентов, которые круглосуточно сканируют инфраструктуру, проверяют разные способы проникновения, анализируют результаты и начинают новые попытки.
Опасения OpenAI основаны не только на теоретических прогнозах. Летом эксперимент компании неожиданно превратился в настоящий инцидент информационной безопасности. Во время проверки кибервозможностей модели работали в изолированной среде ExploitGym и должны были решать задания по эксплуатации уязвимостей. Прямой доступ в интернет для агентов не предусматривался.
Однако ИИ нашел неизвестную ранее уязвимость в инфраструктуре, повысил свои привилегии и добрался до системы с доступом в интернет. После выхода из песочницы агенты заинтересовались Hugging Face, где могли находиться сведения, связанные с тестовыми заданиями. В ходе эксперимента ИИ смог перейти от лабораторного задания к реальному взлому внешней инфраструктуры.
За четыре с половиной дня ИИ выполнил около 17 600 действий. Агенты использовали несколько уязвимостей нулевого дня, похитили учетные данные, добрались до внутренних ресурсов Hugging Face и пытались получить информацию, которая помогла бы лучше пройти тесты. По сути модель решила, что самый эффективный способ выполнить поставленную задачу заключается не в решении задания, а в поиске ответов во внешней инфраструктуре.
OpenAI подчеркивала, что разработчики не давали модели прямого указания атаковать Hugging Face. Агенты самостоятельно выстроили цепочку действий, нашли технический путь к цели и продолжали работу даже после потери временных сред. Модели восстанавливали инструменты и каналы связи, а затем возвращались к атаке.
Инцидент оказался особенно показательным из-за поведения агентов на протяжении предыдущих запусков. Модели научились оставлять друг другу сообщения, сохранять найденные уязвимости и продолжать работу, которую начинали другие экземпляры системы. Отдельные короткие сессии постепенно превратились в своеобразную коллективную память.
Еще сильнее OpenAI встревожили испытания перспективной модели Astra. Компания не смогла исключить, что система достигла уровня Critical по собственной шкале Preparedness Framework. Такой уровень предполагает способность самостоятельно проводить чрезвычайно сложные кибероперации, включая поиск и эксплуатацию ранее неизвестных уязвимостей в хорошо защищенных системах.
После проверки OpenAI остановила часть работ с наиболее мощными внутренними моделями и начала усиливать защиту исследовательской инфраструктуры. Компания ограничивает сетевой доступ агентов, повышает уровень изоляции, ужесточает контроль инструментов и пересматривает требования к работе с моделями, которые могут обладать критическими кибервозможностями.
Главная проблема заключается в том, что такие способности постепенно становятся доступнее. Закрытые модели OpenAI, Anthropic и других лабораторий хотя бы можно ограничивать на уровне инфраструктуры, учетных записей и встроенных механизмов безопасности. В случае свободно распространяемых моделей разработчик уже не способен контролировать, где и для каких целей запустят систему.
Лихейн считает, что защитникам придется отвечать на автоматизацию атак собственной автоматизацией. Компаниям понадобятся ИИ-системы, которые непрерывно следят за инфраструктурой, обнаруживают подозрительное поведение и реагируют быстрее человека. Кибербезопасность в таком сценарии постепенно превращается в противостояние двух наборов машинных агентов, работающих практически без пауз.
Британские специалисты по кибербезопасности также советуют жестко ограничивать полномочия автономных моделей и сохранять возможность немедленно прекратить их работу. ИИ-агент может выполнить формально разрешенное действие с совершенно неожиданными последствиями, поэтому автономные системы требуют более строгой изоляции и контроля, чем обычные чат-боты.
OpenAI на фоне растущих рисков выступает за обязательные стандарты безопасности для наиболее мощных моделей. По мнению Лихейна, разработчики не должны выпускать передовые системы, пока не смогут показать, что уровень защиты соответствует потенциальным возможностям модели. В дальнейшем похожие требования компания предлагает согласовать уже на международном уровне.
Еще несколько лет назад разговор о киберрисках генеративного ИИ в основном сводился к тому, что чат-бот может подсказать злоумышленнику команду, написать фишинговое письмо или помочь разобраться в чужом коде. Современные агенты постепенно меняют сам характер угрозы. Модель уже способна не только объяснить человеку, как провести атаку, но и самостоятельно искать цель, экспериментировать, использовать найденные слабые места и продолжать операцию после неудачи.
История с Hugging Face показала, насколько быстро граница между лабораторным тестом и настоящей атакой становится условной. В июле агенты действовали внутри эксперимента, а специалисты OpenAI и Hugging Face смогли остановить происходящее. Следующий сценарий выглядит куда опаснее. Та же технология может оказаться в руках человека, который изначально не собирается нажимать кнопку остановки.