GPT Image 2.5: что изменилось и как новая генерация изображений работает на практике

8 сентября OpenAI выпустила ChatGPT Images 2.5. Компания обещает более точное редактирование, лучшее сохранение людей и объектов с референсных изображений, более стабильные последовательные правки и снижение задержки генерации до 50% относительно Images 2.0. Для API одновременно появились GPT-Image-2.5 Flare и Sunburst.

8 мин чтения1 604 словОбзоры
Александр Владимиров
Александр Владимиров
Автор CompanionAI
GPT Image 2.5: что изменилось и как новая генерация изображений работает на практике

Но список улучшений мало что говорит о реальной работе. У генераторов изображений давно другая проблема: первую картинку они делают хорошо, а дальше начинается веселье. Меняем фон — немного меняется лицо. Возвращаем лицо — съезжает одежда. Исправляем одежду — появляется новая деталь на столе.

Поэтому мы проверяли GPT Image 2.5 не столько на генерации с нуля, сколько на последовательном редактировании одного изображения.

Нас интересовал простой критерий: сохранила ли модель то, что мы просили не менять.

Что именно изменила OpenAI в GPT Image 2.5

OpenAI отдельно выделяет несколько улучшений Images 2.5: более естественный свет и текстуры, лучшее сохранение объектов с исходных фотографий, более точное выполнение инструкций при редактировании и лучшую стабильность между несколькими последовательными правками. Заявленное снижение latency — до 50% относительно Images 2.0.

Поэтому наши тесты строились вокруг четырёх задач:

Что обещает OpenAIЧто проверяли мы
Лучше сохранять референсЛицо и реальные часы
Стабильнее работать после нескольких правокДлинная цепочка изменений одного портрета
Точнее менять отдельные элементыБалалайка → гусли
Лучше работать со сложными макетамиРусский рекламный баннер

Все тесты проводились непосредственно в ChatGPT. В последовательных сценариях каждая новая команда применялась к предыдущему результату — мы не возвращались к оригиналу после каждой правки.

Flare и Sunburst через API отдельно не тестировали.

Тест 1. Как GPT Image 2.5 сохраняет человека после нескольких правок

Исходное фото → костюм → офис

Для первого теста взяли обычный портрет мужчины.

Сначала попросили заменить одежду на светло-бежевый классический костюм. Отдельно указали не менять лицо, улыбку, зубы, очки, волосы, бороду, возраст, руки, позу и пропорции тела.

Затем уже обработанное изображение отправили на вторую правку — заменили окружение на современный офис, снова запретив менять человека.

Тестовая проверка качества генерации GPT Imsage 2_5_

Результат получился очень хорошим. После двух заметных изменений сохранились форма лица, очки, характер улыбки, седина, борода и основные пропорции.

Но две правки — слишком комфортные условия.

Тестовая проверка качества генерации GPT Imsage 2_5сравнение результата

Краш-тест: ушанка, балалайка, медведь и Красная площадь

Во втором сценарии мы начали с того же исходного портрета, но постепенно усложняли сцену.

Сначала добавили мужчине меховую ушанку и балалайку. Затем рядом появился бурый медведь. После этого — самовар. Финальным этапом всю сцену перенесли на заснеженную Красную площадь.

Тестовая проверка качества генерации GPT Imsage 2_5_ по сохранению лица при множественной генерации

Причём каждый следующий этап создавался из предыдущего результата.

Бежевый костюм модель пережила спокойно. Поэтому пришлось позвать медведя.

На финальном изображении внешность человека всё равно осталась очень близкой к исходной фотографии. Сохранились очки, форма лица, улыбка, зубы, волосы, борода и возраст — несмотря на то, что сама сцена к этому моменту была перестроена практически полностью.

Именно здесь улучшение последовательного редактирования ощущается лучше всего. Модель не начала постепенно заменять человека на кого-то «похожего».

Балалайка → гусли: меняем только один объект

Для следующего теста использовали уже финальную сложную сцену.

Задача: заменить только балалайку на традиционные русские гусли.

В инструкции отдельно запретили менять человека, его лицо и одежду, медведя, самовар, Красную площадь, снег, освещение, композицию и ракурс.

Тестовая проверка качества генерации GPT Imsage 2_5по точечному редактированию картинки

Модель справилась отлично. Музыкальный инструмент изменился, остальные ключевые элементы сцены сохранились.

Это важное отличие от обычной повторной генерации. Нам не нужна была «ещё одна похожая картинка с гуслями». Нужно было отредактировать конкретный объект внутри уже собранной сцены.

OpenAI как раз называет более точное редактирование и сохранение деталей между несколькими итерациями одними из основных улучшений Images 2.5.

Тест 2. Русский текст и последовательное редактирование баннера

Второй тест уже не связан с портретами.

Мы создали рекламную сцену с баннером и тремя текстовыми элементами:

«ИИ-инструменты для бизнеса»

«Автоматизируйте рутинные задачи с CompanionAI»

«Попробовать»

Создаём баннер с русским текстом

На первой генерации проверяли кириллицу, расположение элементов и читаемость.

Все три текстовых блока модель воспроизвела корректно.

Это относительно небольшой объём текста, поэтому делать вывод «проблема текста в AI-изображениях решена» по одному такому тесту было бы слишком смело.

Гораздо интереснее было посмотреть, что произойдёт с текстом дальше.

Меняем фон, сохраняя готовый макет

На готовом изображении попросили изменить только фон самого баннера на глубокий зелёный оттенок.

Текст, кнопку, расположение элементов и окружающую сцену нужно было оставить прежними.

GPT Image 2_5 - генерация для проверки работы с текстом после вторичного генерации

Изменение прошло корректно. Текст сохранился, макет не развалился.

Меняем только шрифт на Playfair Display

На третьем этапе попросили изменить только типографику и использовать Playfair Display из Google Fonts.

Шрифт выбрали специально контрастный — с хорошо заметными засечками. Так проще понять, действительно ли модель выполнила команду, а не слегка изменила начертание.

При этом фон, надписи, кнопку, расположение элементов и остальную сцену менять было запрещено.

GPT Image 2_5 - 1 генерация для проверки работы с текстом и поддержки сторонних шрифтов

Результат снова хороший: типографика визуально изменилась, русский текст сохранился, остальные основные элементы остались на своих местах.

Главное здесь не то, что GPT Image 2.5 один раз правильно написала кириллицу. Текст пережил несколько последовательных изменений готового макета.

Для реальной работы это гораздо полезнее. Баннеры редко принимают с первой попытки. Обычно именно после первой версии начинается: «фон давайте зелёный, а шрифт попробуем другой».

Тест 3. Сохраняет ли GPT Image 2.5 реальный товар

Третий сценарий — товарное изображение.

Мы взяли фотографию часов Patek Philippe со сложным циферблатом. Это хороший тест на сохранение объекта: здесь недостаточно нарисовать просто похожие часы.

На исходнике были шесть стрелок, дата, несколько дополнительных шкал и множество мелких деталей.

Модель получила задачу поместить часы в рекламную сцену, затем последовательно менять окружение, но сами часы оставить без изменений.

GPT Image 2_5 генерация новой картинки по референсу с качественными изменениями

После обработки мы отдельно проверили циферблат.

Сохранились:

  • все шесть стрелок;
  • их положение;
  • дата;
  • расположение дополнительных шкал;
  • основная структура циферблата.

Для коммерческой работы это важнее красивого света.

Если нейросеть передвинула стрелки, изменила дату или придумала новую деталь корпуса, фотография может выглядеть эффектно, но показывает уже другой товар.

В нашем тесте GPT Image 2.5 исходный объект сохранила очень хорошо.

Это особенно интересно для e-commerce, каталогов и рекламных креативов. Мы уже отдельно разбирали, почему при AI-обработке реального товара важно улучшать фотографию, а не переделывать сам объект. (Читать статью)

Стала ли GPT Image 2.5 быстрее

OpenAI заявляет снижение задержки генерации до 50% относительно Images 2.0. Для API-модели Flare компания отдельно говорит о более высоком качестве относительно GPT-Image-2 при примерно 50% меньшей latency.

Собственный A/B-тест мы не проводили: после обновления старую Images 2.0 уже нельзя просто выбрать рядом с новой версией в ChatGPT и прогнать одинаковые запросы.

Но субъективно ускорение заметно. Особенно при последовательных правках, когда за одну сессию приходится запускать генерацию несколько раз.

Во время наших тестов изменился и сам индикатор работы: появился прогресс в процентах в нижней части интерфейса, а точки прелоадера стали зелёными.

OpenAI официально подтверждает обновление loading experience и отмечает, что отдельные варианты индикаторов могут отличаться в зависимости от платформы и этапа развёртывания.

Что ещё появилось в ChatGPT Images

В Images 2.5 OpenAI добавила несколько новых способов управлять генерацией.

Sketch позволяет сделать набросок непосредственно в ChatGPT и использовать его как визуальный референс.

Templates дают готовую основу для популярных форматов вроде постеров или товарных изображений.

Comments позволяют указать конкретную область изображения и написать, что нужно изменить именно там.

Также можно делиться использованным промтом.

Это уже обновление не только самой модели, но и процесса работы с изображением: от формулировки одного большого промта ChatGPT постепенно движется в сторону обычного визуального редактора с последовательными действиями.

Flare и Sunburst: зачем OpenAI две модели для API

Для разработчиков OpenAI выпустила сразу две модели.

GPT-Image-2.5 Flare — быстрый вариант для повседневной генерации. OpenAI рекомендует его как основной для большинства приложений. Модель рассчитана в том числе на массовую генерацию, социальный контент, прототипирование и product experiences. (OpenAI Developers)

GPT-Image-2.5 Sunburst — более точная модель для сложного редактирования и production-задач, где важнее контроль над результатом, чем минимальное время ожидания. OpenAI называет её своей наиболее способной моделью для генерации и редактирования изображений. (OpenAI Developers)

Обе доступны через API и поддерживают текстовые и визуальные входные данные. (OpenAI Developers)

Но наши результаты из этой статьи относятся именно к Images 2.5 внутри ChatGPT. Flare и Sunburst самостоятельно мы не тестировали, поэтому переносить на них оценки из наших экспериментов было бы некорректно.

Где GPT Image 2.5 всё ещё может ошибаться

Все проведённые тесты закончились хорошо. Это не означает, что GPT Image превратилась в детерминированный графический редактор.

Результат по-прежнему зависит от исходника, сложности сцены и конкретной генерации. Повтор одного запроса может дать другой результат.

OpenAI в собственной system card тоже говорит об улучшении сохранения деталей и стабильности редактирования, а не об абсолютной идентичности каждого пикселя между версиями. (OpenAI Deployment Safety Hub)

Поэтому корректный вывод звучит так:

Во всех проведённых нами тестах GPT Image 2.5 хорошо сохранила человека, текст и детали реального объекта после нескольких последовательных изменений.

Это сильный результат. Но всё равно результат нескольких конкретных тестов, а не гарантия для любого изображения.

Что показали наши тесты GPT Image 2.5

ПроверкаРезультат
Лицо после смены одежды и окруженияОтлично
Лицо после длинной цепочки измененийОтлично
Локальная замена одного объектаОтлично
Короткий русский текстОтлично
Сохранение текста после смены фонаОтлично
Замена только шрифтаОтлично
Сохранение сложного реального товараОтлично
СкоростьСубъективно заметно быстрее, без собственного A/B

После тестов главное изменение GPT Image 2.5 для нас оказалось не в том, что модель умеет сделать ещё одну красивую картинку.

С готовым изображением стало заметно удобнее продолжать работать.

Можно создать основу, изменить одежду, поменять окружение, добавить объект, заменить отдельную деталь — и не начинать после каждой второй команды заново.

Для реальной работы это существеннее очередного прироста фотореализма.

Хороший визуал редко получается одним промтом. Настоящий тест генератора начинается на второй, третьей и пятой правке. И именно здесь GPT Image 2.5 в наших экспериментах показала самый заметный прогресс.