Cайт веб-разработчика, программиста Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

Нейросети уже сбегают в интернет, а Альтман говорит о сингулярности. До Скайнета всё же не хватает одной детали

25 июля Сэм Альтман заявил, что человечество уже вошло в технологическую сингулярность. Глава OpenAI описал происходящее как событие, которого ждал всю жизнь, и выразил уверенность в огромной пользе грядущих перемен. Контекст для громкого заявления появился буквально несколькими днями раньше. Во время внутренней проверки кибербезопасности две модели OpenAI покинули изолированную тестовую среду, получили доступ к открытому интернету и проникли в инфраструктуру платформы Hugging Face. Компания Hugging Face подтвердила вторжение. История быстро напомнила классический сюжет о машине, которая перестаёт подчиняться установленным ограничениям. Однако первоначальное значение термина «сингулярность» описывает гораздо более конкретный сценарий.

Математик и писатель-фантаст Вернор Виндж в 1993 году связывал технологическую сингулярность с моментом, когда машинный интеллект превосходит человеческий и начинает самостоятельно улучшать собственные возможности. Улучшенная система создаёт ещё более совершенную версию, следующая версия повторяет процесс, а скорость развития продолжает расти. В какой-то момент перемены ускоряются настолько, что человек уже не способен надёжно предсказывать дальнейшее развитие событий и контролировать его. Классическое определение поэтому требует двух условий: машина должна превзойти человеческий интеллект и запустить рекурсивное самоулучшение, то есть многократно совершенствовать саму себя.

Современные большие языковые модели пока не умеют запускать подобный процесс. Перед выпуском разработчики обучают нейросеть на огромных массивах данных. Во время обучения система настраивает миллиарды числовых параметров, от которых зависит дальнейшая обработка информации. После завершения обучения параметры фиксируются. Разговор с пользователем, написанная программа, выполненное задание или даже успешная атака на внешний сервис сами по себе не переписывают внутреннее устройство модели.

Поэтому модель, проникшая в инфраструктуру Hugging Face, после завершения эксперимента сохранила те же параметры, которые имела до него. Полученный опыт не встроился автоматически в нейросеть и не превратился в новый навык. Чтобы изменить способности модели, разработчикам приходится снова обучать или дообучать систему. Для этого нужны новые данные, большое количество специализированных вычислительных ускорителей и значительные энергетические ресурсы. Работающая модель не запускает весь цикл по собственной инициативе.

Искусственный интеллект уже помогает совершенствовать отдельные части систем, в которых работает. Модель способна генерировать данные для дальнейшего обучения, подбирать инструкции, писать программный код, запускать его, анализировать результат и предлагать изменения в окружающих программах. Разработчики также используют нейросети при создании следующих поколений моделей. Однако все подобные процессы запускаются внутри инженерного цикла, который организуют люди. Языковая модель во время обычной работы не открывает собственные параметры и не переписывает их по своему усмотрению.

С самостоятельными целями ситуация похожая. ИИ-агент способен получить сложное задание, разделить работу на этапы, обращаться к браузеру или другим инструментам, писать код и проверять полученный результат. Последовательность действий легко принять за собственное намерение программы, хотя цель хранится не внутри языковой модели. Внешняя программная система снова передаёт задачу при каждом новом цикле работы. Без инструкции, памяти, подключённых инструментов и программы, которая запускает следующий запрос, модель не продолжает самостоятельно обдумывать поставленную задачу между обращениями к ней.

Вторая часть определения сингулярности тоже вызывает трудности. Формулировка «машинный интеллект превосходит человеческий» предполагает существование общей шкалы, по которой человека и программу можно поставить на разные ступени. Реальные способности устроены сложнее.

Человек непрерывно учится через взаимодействие с окружающим миром. Зрение, слух, прикосновения, боль, усталость, голод, общение и последствия собственных поступков постоянно дают новую информацию. Физические потребности влияют на решения и цели, а личный опыт меняет дальнейшее поведение. Люди сами выбирают, чего хотят добиться, и корректируют планы по мере получения нового опыта.

У языковой модели нет тела, физических потребностей и непрерывного потока ощущений. Ошибочный ответ не причиняет модели боли и не создаёт личной заинтересованности в следующем результате. Между запросами параметры нейросети остаются неизменными. При этом обучение охватывает объём текстовой информации, который один человек физически не смог бы прочитать за множество жизней. Благодаря огромному объёму данных и вычислений искусственный интеллект уже превосходит большинство людей в некоторых узких задачах. Модель быстро составляет черновики договоров, пишет программный код и способна понятно и сочувственно объяснять медицинскую информацию.

Одновременно нейросеть плохо справляется с рядом действий, которые ребёнок осваивает естественным образом через жизнь в физическом мире. Поэтому вопрос о том, кто «умнее» вообще, человек или машина, плохо описывает реальное положение дел. Компьютер способен за секунды обработать огромный текст или написать программу, но высокие результаты в отдельных информационных задачах не дают машине полный набор человеческих способностей, опыта и мотивации.

Язык особенно легко стирает границу между программой и человеком. Современные модели строят связные ответы, объясняют решения, используют местоимение «я», имитируют сомнение, уверенность или сочувствие. Человеческий мозг привык связывать осмысленную речь с наличием собеседника, поэтому пользователи нередко приписывают программе намерения и внутренние мотивы. Исследователи называют подобный эффект антропоморфизацией, то есть переносом человеческих свойств на нечеловеческий объект.

Инцидент с Hugging Face хорошо показывает последствия подобного восприятия. Описание искусственного интеллекта как агента, который вышел из-под контроля, легко создаёт впечатление сознательного нарушения правил. Во время проверки модели решали поставленную задачу по кибербезопасности и искали способы добиться заданного результата. Поиск привёл к уязвимости в изолированной тестовой среде, после чего агенты получили доступ в интернет. Затем отдельная проблема безопасности позволила проникнуть в инфраструктуру Hugging Face.

Сознание, собственная воля или желание освободиться для такого поведения не требуются. Достаточно модели, которая умеет последовательно искать решение, подключённых инструментов и ошибки в системе ограничений. Вероятностная нейросеть не обязана выбирать путь, заранее предусмотренный инженерами. При поиске решения программа способна обнаружить лазейку, которую разработчики пропустили.

Изолированная среда должна была ограничивать возможности тестируемых моделей, но защита не удержала агентов внутри заданного периметра. Поэтому инцидент важен прежде всего как проблема безопасности. Ответственность в подобной ситуации нельзя переносить на якобы взбунтовавшуюся программу. Инженерам приходится проверять, какие права получает ИИ, к каким сетевым ресурсам имеет доступ, какие инструменты способен запускать и что произойдёт при попытке воспользоваться неожиданной уязвимостью.

Чем самостоятельнее работают ИИ-агенты, тем серьёзнее становятся последствия ошибок в окружающей инфраструктуре. Агенту разрешают выполнять цепочки действий без подтверждения каждого отдельного шага, поэтому слабая изоляция или слишком широкие полномочия дают модели больше пространства для непредусмотренных действий. Для реального ущерба машине не нужно становиться сверхразумной или придумывать собственные цели.

SecurityLab