OpenAI научила ChatGPT превращать каракули в готовые изображения
Объяснять нейросети расположение каждого объекта словами больше не обязательно. OpenAI представила ChatGPT Images 2.5, новую модель для генерации и редактирования изображений, которая позволяет нарисовать примерную композицию прямо в ChatGPT, а затем превратить черновой набросок в полноценный кадр. Одновременно разработчики ускорили генерацию, улучшили работу с референсами и постарались решить проблему, из-за которой последовательные правки постепенно разрушали исходную картинку.
По данным OpenAI, задержка при генерации сократилась до 50% по сравнению с Images 2.0. Новая модель точнее передаёт освещение и текстуры, лучше сохраняет узнаваемые черты людей с загруженных фотографий и аккуратнее выполняет локальные изменения. При просьбе заменить отдельный предмет, фон или надпись Images 2.5 реже затрагивает композицию и детали, которые пользователь менять не просил.
Устойчивость к последовательным изменениям стала одним из основных направлений обновления. Предыдущая Images 2.0 уже позволяла править готовые изображения в диалоге без полной генерации с нуля, однако длинная цепочка изменений могла постепенно менять первоначальный результат. Images 2.5 лучше удерживает внесённые ранее правки и сохраняет качество изображения при дальнейшей работе.
Самой заметной функцией стала Sketch, или «Набросок». Пользователь рисует простую схему с формой объектов и приблизительной композицией, добавляет описание желаемого стиля и деталей, после чего ChatGPT использует рисунок как визуальный референс. В качестве примеров OpenAI приводит планировку комнаты, контур одежды и обычный рисунок от руки. На мобильных устройствах функцию можно вызвать через команду @Sketch.
В ChatGPT также появились шаблоны для распространённых творческих задач. Среди примеров OpenAI называет постеры, мерч, рекламные материалы и фотографии товаров. Пользователь выбирает основу, задаёт текст, элементы дизайна и стиль, поэтому начинать каждый проект с полностью пустого запроса больше не требуется.
Редактирование стало ближе к работе в обычном графическом редакторе. На изображении можно оставить комментарий возле конкретного объекта и описать нужное изменение. Такой способ помогает точнее указать модели область правки вместо длинного текстового объяснения. Готовой работой теперь разрешено делиться вместе с промптом, чтобы другой пользователь мог взять исходную идею и создать собственную версию с другими фотографиями или деталями.
Images 2.5 также лучше справляется со сложными макетами, прозрачным фоном и изображениями, где требуется учитывать информацию о реальном мире. OpenAI рассчитывает использовать повышенную стабильность не только для обычных картинок, но и для серий рекламных материалов, интерфейсных концепций, презентационной графики и других задач, где стиль и расположение элементов должны оставаться одинаковыми после нескольких изменений.
Для разработчиков OpenAI выпустила две модели семейства GPT-Image-2.5. Flare рассчитана на повседневную и массовую генерацию и выбрана в качестве основного варианта для большинства приложений. По заявлению компании, Flare выдаёт изображения более высокого качества, чем GPT-Image-2, при задержке на 50% ниже. Модель подходит для контента в социальных сетях, товарных изображений, визуального поиска, быстрого прототипирования и сервисов с большим количеством генераций.
GPT-Image-2.5 Sunburst ориентирована на задачи, где важнее максимальная точность редактирования. Модель работает дольше и предназначена, например, для готовых рекламных материалов и тщательно обработанных изображений товаров. Обе версии уже доступны через API.
Вместе с качеством OpenAI сохранила прежние механизмы защиты. Система проверяет запросы и изображения на запрещённый контент, а созданные картинки получают метаданные C2PA и невидимую маркировку, которые помогают определить происхождение сгенерированного материала.
ChatGPT Images 2.5 начинают распространять среди пользователей всех тарифов ChatGPT, ChatGPT Work и Codex. Обновление выходит в веб-версии, настольных приложениях и на мобильных устройствах. Масштаб обновления для OpenAI особенно заметен на фоне объёма использования генератора: через ChatGPT Images и модели GPT-Image в API пользователи создают более 3 млрд изображений каждую неделю.