Искусственный интеллект лишили права на «почти правильно». Представлен HardFlow для опасных задач
Исследователи представили HardFlow, метод для генеративного искусственного интеллекта, который заставляет уже обученные модели соблюдать жёсткие ограничения, например не прокладывать роботу путь через препятствие. В испытаниях HardFlow выполнил все заданные ограничения в задачах робототехники, навигации и редактирования изображений без повторного обучения модели, что особенно важно там, где «почти правильный» результат всё равно считается ошибкой.
Жёстким ограничением авторы называют условие, которое нельзя нарушить ради более высокого качества результата. Робот может выбирать более длинный или менее удобный маршрут, но не должен столкнуться с препятствием. Система управления может расходовать больше энергии, но обязана оставаться в установленных физических пределах. При редактировании фотографии нейросеть может менять выражение лица, но должна сохранить сходство с исходным человеком.
HardFlow рассчитан прежде всего на модели согласования потоков, близкие по принципу работы к диффузионным моделям. Такие системы начинают со случайного шума и постепенно преобразуют его в изображение, траекторию движения или другой результат. Каждый промежуточный вариант служит лишь очередным шагом вычислений и обычно не используется напрямую.
Существующие методы часто пытаются удерживать каждый промежуточный шаг внутри разрешённой области. После очередного изменения результат проверяют и при необходимости принудительно возвращают к допустимому состоянию. Авторы HardFlow считают такой подход слишком жёстким: ранние промежуточные варианты ещё сильно похожи на шум, поэтому преждевременные ограничения могут отсечь путь к более качественному решению.
HardFlow вместо постоянных исправлений рассматривает генерацию как задачу оптимизации траектории. Алгоритм использует методы оптимального и прогнозирующего управления, чтобы небольшими корректировками направлять процесс к результату, который одновременно выполняет обязательные условия и остаётся как можно ближе к обычному выводу исходной модели. Дополнительная цель может требовать, например, не просто найти безопасный путь для робота, а сделать его ещё и коротким.
Контроль ограничений только на конечном результате не означает, что робот получает право врезаться в препятствия по дороге. В задачах планирования конечным результатом нейросети служит вся рассчитанная траектория целиком. Поэтому условие отсутствия столкновений проверяется для пути, который машина должна пройти от начала до конца.
В одном из экспериментов манипулятор должен был добраться до цели между препятствиями, часть которых добавили только во время испытаний. Авторы провели 50 запусков. HardFlow оказался единственным из проверенных методов, который завершил все попытки без столкновений, а безопасные маршруты занимали в среднем 52,5 шага. У ближайшего по безопасности варианта доля успешных попыток составила 76%, а средний путь вырос примерно до 67 шагов.
Похожую проверку провели в двумерном лабиринте. Управляемый объект должен был добраться до цели, обходя запрещённые области. В 50 испытаниях HardFlow не допустил ни одного захода в препятствия и получил лучший результат по скорости достижения цели среди сравниваемых подходов. Следующий по безопасности метод прошёл без нарушений 88% испытаний.
Ещё один эксперимент проверял управление физическим процессом, описанным уравнением Бюргерса, которое используют при моделировании потоков жидкости и других динамических систем. Алгоритму задали меняющиеся во времени пределы для состояния системы. Несколько методов смогли полностью выполнить ограничения, но HardFlow среди них потребовал меньше всего управляющего воздействия и показал наименьшее время вычислений.
Отдельно авторы испытали HardFlow при редактировании лиц по текстовым командам. Нейросеть просили, например, сделать человека улыбающимся, грустным или визуально более старым, одновременно запретив слишком сильное изменение исходного изображения. Проверка охватила 200 фотографий и пять вариантов задания. HardFlow единственным выполнил установленное ограничение во всех случаях.
Для оценки сходства использовали показатель LPIPS, который измеряет воспринимаемую разницу между двумя изображениями. Допустимый максимум составлял 0,06, у HardFlow среднее значение достигло 0,048. Время обработки составило около 51 секунды, тогда как три сравниваемых метода требовали примерно от 129 до 158 секунд. При этом качество выполнения текстовой команды осталось близким к лучшему результату среди конкурентов.
Метод не требует менять параметры исходной нейросети или заново её обучать. HardFlow подключается во время генерации и корректирует движение модели к допустимому результату. Такой подход позволяет применять новые ограничения к уже готовой системе, хотя за гибкость приходится платить дополнительными вычислениями при каждом запуске.
HardFlow пока нельзя считать универсальным механизмом безопасности для любого искусственного интеллекта. Работа сосредоточена на моделях согласования потоков и родственном классе генеративных систем, а основные проверки проходили в контролируемых экспериментальных задачах. Авторы отдельно называют более сложные сценарии с обработкой изображений высокого разрешения, взаимодействием роботов с физическими объектами и другими реальными условиями направлениями для дальнейшей проверки.
Есть и более фундаментальное ограничение: HardFlow способен гарантировать выполнение только тех правил, которые разработчик сумел точно задать математически. Алгоритм может строго соблюдать условие обхода известных препятствий, предел скорости или допустимую степень изменения изображения, но сам по себе не определяет, полностью ли такие условия описывают безопасность реальной системы. Поэтому HardFlow скорее добавляет генеративным моделям механизм строгого исполнения формализованных требований, чем превращает их в заведомо безопасные системы.