8 сентября OpenAI выпустила ChatGPT Images 2.5. Компания обещает более точное редактирование, лучшее сохранение людей и объектов с референсных изображений, более стабильные последовательные правки и снижение задержки генерации до 50% относительно Images 2.0. Для API одновременно появились GPT-Image-2.5 Flare и Sunburst.


Но список улучшений мало что говорит о реальной работе. У генераторов изображений давно другая проблема: первую картинку они делают хорошо, а дальше начинается веселье. Меняем фон — немного меняется лицо. Возвращаем лицо — съезжает одежда. Исправляем одежду — появляется новая деталь на столе.
Поэтому мы проверяли GPT Image 2.5 не столько на генерации с нуля, сколько на последовательном редактировании одного изображения.
Нас интересовал простой критерий: сохранила ли модель то, что мы просили не менять.
OpenAI отдельно выделяет несколько улучшений Images 2.5: более естественный свет и текстуры, лучшее сохранение объектов с исходных фотографий, более точное выполнение инструкций при редактировании и лучшую стабильность между несколькими последовательными правками. Заявленное снижение latency — до 50% относительно Images 2.0.
Поэтому наши тесты строились вокруг четырёх задач:
| Что обещает OpenAI | Что проверяли мы |
| Лучше сохранять референс | Лицо и реальные часы |
| Стабильнее работать после нескольких правок | Длинная цепочка изменений одного портрета |
| Точнее менять отдельные элементы | Балалайка → гусли |
| Лучше работать со сложными макетами | Русский рекламный баннер |
Все тесты проводились непосредственно в ChatGPT. В последовательных сценариях каждая новая команда применялась к предыдущему результату — мы не возвращались к оригиналу после каждой правки.
Flare и Sunburst через API отдельно не тестировали.
Для первого теста взяли обычный портрет мужчины.
Сначала попросили заменить одежду на светло-бежевый классический костюм. Отдельно указали не менять лицо, улыбку, зубы, очки, волосы, бороду, возраст, руки, позу и пропорции тела.
Затем уже обработанное изображение отправили на вторую правку — заменили окружение на современный офис, снова запретив менять человека.

Результат получился очень хорошим. После двух заметных изменений сохранились форма лица, очки, характер улыбки, седина, борода и основные пропорции.
Но две правки — слишком комфортные условия.

Во втором сценарии мы начали с того же исходного портрета, но постепенно усложняли сцену.
Сначала добавили мужчине меховую ушанку и балалайку. Затем рядом появился бурый медведь. После этого — самовар. Финальным этапом всю сцену перенесли на заснеженную Красную площадь.

Причём каждый следующий этап создавался из предыдущего результата.
Бежевый костюм модель пережила спокойно. Поэтому пришлось позвать медведя.
На финальном изображении внешность человека всё равно осталась очень близкой к исходной фотографии. Сохранились очки, форма лица, улыбка, зубы, волосы, борода и возраст — несмотря на то, что сама сцена к этому моменту была перестроена практически полностью.
Именно здесь улучшение последовательного редактирования ощущается лучше всего. Модель не начала постепенно заменять человека на кого-то «похожего».
Для следующего теста использовали уже финальную сложную сцену.
Задача: заменить только балалайку на традиционные русские гусли.
В инструкции отдельно запретили менять человека, его лицо и одежду, медведя, самовар, Красную площадь, снег, освещение, композицию и ракурс.

Модель справилась отлично. Музыкальный инструмент изменился, остальные ключевые элементы сцены сохранились.
Это важное отличие от обычной повторной генерации. Нам не нужна была «ещё одна похожая картинка с гуслями». Нужно было отредактировать конкретный объект внутри уже собранной сцены.
OpenAI как раз называет более точное редактирование и сохранение деталей между несколькими итерациями одними из основных улучшений Images 2.5.
Второй тест уже не связан с портретами.
Мы создали рекламную сцену с баннером и тремя текстовыми элементами:
«ИИ-инструменты для бизнеса»
«Автоматизируйте рутинные задачи с CompanionAI»
«Попробовать»
На первой генерации проверяли кириллицу, расположение элементов и читаемость.

Все три текстовых блока модель воспроизвела корректно.
Это относительно небольшой объём текста, поэтому делать вывод «проблема текста в AI-изображениях решена» по одному такому тесту было бы слишком смело.
Гораздо интереснее было посмотреть, что произойдёт с текстом дальше.
На готовом изображении попросили изменить только фон самого баннера на глубокий зелёный оттенок.
Текст, кнопку, расположение элементов и окружающую сцену нужно было оставить прежними.

Изменение прошло корректно. Текст сохранился, макет не развалился.
На третьем этапе попросили изменить только типографику и использовать Playfair Display из Google Fonts.
Шрифт выбрали специально контрастный — с хорошо заметными засечками. Так проще понять, действительно ли модель выполнила команду, а не слегка изменила начертание.
При этом фон, надписи, кнопку, расположение элементов и остальную сцену менять было запрещено.

Результат снова хороший: типографика визуально изменилась, русский текст сохранился, остальные основные элементы остались на своих местах.
Главное здесь не то, что GPT Image 2.5 один раз правильно написала кириллицу. Текст пережил несколько последовательных изменений готового макета.
Для реальной работы это гораздо полезнее. Баннеры редко принимают с первой попытки. Обычно именно после первой версии начинается: «фон давайте зелёный, а шрифт попробуем другой».
Третий сценарий — товарное изображение.
Мы взяли фотографию часов Patek Philippe со сложным циферблатом. Это хороший тест на сохранение объекта: здесь недостаточно нарисовать просто похожие часы.
На исходнике были шесть стрелок, дата, несколько дополнительных шкал и множество мелких деталей.
Модель получила задачу поместить часы в рекламную сцену, затем последовательно менять окружение, но сами часы оставить без изменений.

После обработки мы отдельно проверили циферблат.
Сохранились:
Для коммерческой работы это важнее красивого света.
Если нейросеть передвинула стрелки, изменила дату или придумала новую деталь корпуса, фотография может выглядеть эффектно, но показывает уже другой товар.
В нашем тесте GPT Image 2.5 исходный объект сохранила очень хорошо.
Это особенно интересно для e-commerce, каталогов и рекламных креативов. Мы уже отдельно разбирали, почему при AI-обработке реального товара важно улучшать фотографию, а не переделывать сам объект. (Читать статью)
OpenAI заявляет снижение задержки генерации до 50% относительно Images 2.0. Для API-модели Flare компания отдельно говорит о более высоком качестве относительно GPT-Image-2 при примерно 50% меньшей latency.
Собственный A/B-тест мы не проводили: после обновления старую Images 2.0 уже нельзя просто выбрать рядом с новой версией в ChatGPT и прогнать одинаковые запросы.
Но субъективно ускорение заметно. Особенно при последовательных правках, когда за одну сессию приходится запускать генерацию несколько раз.
Во время наших тестов изменился и сам индикатор работы: появился прогресс в процентах в нижней части интерфейса, а точки прелоадера стали зелёными.
OpenAI официально подтверждает обновление loading experience и отмечает, что отдельные варианты индикаторов могут отличаться в зависимости от платформы и этапа развёртывания.
В Images 2.5 OpenAI добавила несколько новых способов управлять генерацией.
Sketch позволяет сделать набросок непосредственно в ChatGPT и использовать его как визуальный референс.
Templates дают готовую основу для популярных форматов вроде постеров или товарных изображений.
Comments позволяют указать конкретную область изображения и написать, что нужно изменить именно там.
Также можно делиться использованным промтом.
Это уже обновление не только самой модели, но и процесса работы с изображением: от формулировки одного большого промта ChatGPT постепенно движется в сторону обычного визуального редактора с последовательными действиями.
Для разработчиков OpenAI выпустила сразу две модели.
GPT-Image-2.5 Flare — быстрый вариант для повседневной генерации. OpenAI рекомендует его как основной для большинства приложений. Модель рассчитана в том числе на массовую генерацию, социальный контент, прототипирование и product experiences. (OpenAI Developers)
GPT-Image-2.5 Sunburst — более точная модель для сложного редактирования и production-задач, где важнее контроль над результатом, чем минимальное время ожидания. OpenAI называет её своей наиболее способной моделью для генерации и редактирования изображений. (OpenAI Developers)
Обе доступны через API и поддерживают текстовые и визуальные входные данные. (OpenAI Developers)
Но наши результаты из этой статьи относятся именно к Images 2.5 внутри ChatGPT. Flare и Sunburst самостоятельно мы не тестировали, поэтому переносить на них оценки из наших экспериментов было бы некорректно.
Все проведённые тесты закончились хорошо. Это не означает, что GPT Image превратилась в детерминированный графический редактор.
Результат по-прежнему зависит от исходника, сложности сцены и конкретной генерации. Повтор одного запроса может дать другой результат.
OpenAI в собственной system card тоже говорит об улучшении сохранения деталей и стабильности редактирования, а не об абсолютной идентичности каждого пикселя между версиями. (OpenAI Deployment Safety Hub)
Поэтому корректный вывод звучит так:
Во всех проведённых нами тестах GPT Image 2.5 хорошо сохранила человека, текст и детали реального объекта после нескольких последовательных изменений.
Это сильный результат. Но всё равно результат нескольких конкретных тестов, а не гарантия для любого изображения.
| Проверка | Результат |
|---|---|
| Лицо после смены одежды и окружения | Отлично |
| Лицо после длинной цепочки изменений | Отлично |
| Локальная замена одного объекта | Отлично |
| Короткий русский текст | Отлично |
| Сохранение текста после смены фона | Отлично |
| Замена только шрифта | Отлично |
| Сохранение сложного реального товара | Отлично |
| Скорость | Субъективно заметно быстрее, без собственного A/B |
После тестов главное изменение GPT Image 2.5 для нас оказалось не в том, что модель умеет сделать ещё одну красивую картинку.
С готовым изображением стало заметно удобнее продолжать работать.
Можно создать основу, изменить одежду, поменять окружение, добавить объект, заменить отдельную деталь — и не начинать после каждой второй команды заново.
Для реальной работы это существеннее очередного прироста фотореализма.
Хороший визуал редко получается одним промтом. Настоящий тест генератора начинается на второй, третьей и пятой правке. И именно здесь GPT Image 2.5 в наших экспериментах показала самый заметный прогресс.