Автор: Сергей Погодаев, эксперт по нейросетям, генеральный директор СТИВА
Я генерирую изображения через нейросети каждый день с 2023 года. За это время у меня накопилась коллекция из примерно 40 000 картинок. И знаете, что общего у 90% неудачных генераций? Лица. Руки. Текст. Точнее - попытка их сохранить при редактировании.
GPT Image 2.5 - это первая модель от OpenAI, которая реально решает эти три проблемы и мы добавили модель GPT Image 2.5 в STIVA.ai!
Загружаешь фото клиента, пишешь «сделай деловой портрет в офисе» - получаешь человека с другими глазами. Пишешь «поменяй фон на размытый офис» - получаешь другой нос. Пишешь «добавь текст на баннер» - получаешь галлюлинации вместо букв.
Допустим, у вас есть селфи клиента. Хотите сделать из него деловой портрет, фотосессию на день рождения, аватар для соцсетей. Загружаете фото в нейросеть, пишете промпт - и получаете... другого человека. Тот же пол, тот же возраст, но другие черты. Глаза чуть уже, скулы чуть шире, нос другой. Клиент смотрит и говорит: «Это не я».
С GPT Image 2.5 - другой подход. Модель «видит» загруженное фото и переносит черты в новое изображение. Не подменяет, не генерирует похожего человека - сохраняет именно то лицо, которое вы загрузили. Черты, пропорции, мимику, текстуру кожи.
Я тестировал на 20 фотографиях разных людей. Результат: 17 из 20 - узнаваемо тот же человек. 3 из 20 - похож, но не точно. Для сравнения, GPT Image 2 давал 8 из 20. Nano Banana Pro - 15 из 20. Модель от OpenAI наконец догнала конкурентов по сохранению лиц.
Ещё одна боль: загружаете фото, пишете «поменяй фон на офисный» - модель меняет фон, но заодно «поправляет» и человека. Другая поза, другой свет на лице, другая одежда. Вы просили поменять одно - поменялось всё.
GPT Image 2.5 делает то, что вы просите, и оставляет остальное нетронутым. «Поменяй фон» - меняется только фон. «Добавь логотип в угол» - добавляется логотип, остальное без изменений. «Сделай свет теплее» - свет теплее, композиция та же.
Это работает даже со сложными субъектами и фонами. Человек в кресле в интерьере - можно поменять кресло, не тронув человека. Или поменять человека, не тронув интерьер. Раньше это было невозможно без маскирования и Photoshop.
Третья боль: серия правок. Первая правка - отлично. Вторая - хорошо. Третья - нормально. Четвёртая - модель начинает «плавить» изображение. Пятая - артефакты, размытие, потеря деталей. Приходится начинать заново.
GPT Image 2.5 сохраняет качество через несколько итераций. Я делал 7 правок подряд - седьмая по качеству не уступает первой. Каждое новое изменение строится на предыдущем, без потери деталей.
Для чего это нужно? Для рабочего процесса. Сгенерировал - посмотрел - поправил - поправил ещё - получил финальный результат. Без «начни заново» после третьей правки.
Новая функция, которой не было раньше. Рисуете скетч прямо в ChatGPT - и модель использует его как визуальный референс для финального изображения.
Пример: нарисовали от руки раскладку рекламного баннера. Заголовок слева, фото справа, кнопка внизу. GPT Image 2.5 берёт этот скетч и создаёт готовый баннер - с тем же расположением элементов, но с фотореалистичным качеством.
Другой пример: нарисовали раскадровку для видео - три кадра в ряд. Модель генерирует три изображения, соответствующих кадрам. Скетч как режиссёрский план, нейросеть как исполнитель.
Ввод: @Sketch в чате. Рисуете на экране. Модель понимает расположение элементов и создаёт финальное изображение.
Ещё одна новая функция. Шаблоны для популярных форматов: флаеры, продуктовые фото, обложки для соцсетей, рекламные баннеры. Не нужно писать длинный промпт - выбрали шаблон, загрузили своё фото, получили результат.
Пример: нужно фото товара для маркетплейса. Выбираете шаблон «продуктовое фото», загружаете фото товара на белом фоне, получаете студийный кадр с тёплым светом и размытым фоном. 30 секунд вместо 30 минут с фотографом.
Раньше генерация изображений с прозрачным фоном была лотереей. Иногда - чистый PNG с прозрачным фоном. Иногда - белый фон вместо прозрачного. Иногда - «дыры» в объекте, где фон «протёк».
GPT Image 2.5 генерирует прозрачные фоны надёжно. По данным Manus: «улучшенная генерация прозрачных фонов - отлично подходит для креативной работы». Для каталогов маркетплейсов, продуктовых фото, рекламных креативов - теперь не нужно отдельно вырезать фон.
OpenAI выпустил две версии для разработчиков:
GPT-Image-2.5 Flare - для большинства задач. В 2-4 раза быстрее GPT Image 2 (по данным Manus). Высокое качество при низкой задержке. Подходит: контент для соцсетей, визуальный поиск, прототипирование, массовая генерация. По данным Higgsfield AI: «понимает, что не менять - можно внести значимую правку без потери характера, композиции и визуальной идентичности».
GPT-Image-2.5 Sunburst - для премиум-задач. Точнее редактирование, дольше генерация. Для рекламных кампаний, продакшн-креативов, полированных продуктовых фото. Дополнительные слои безопасности для изображений.
Цены одинаковые: $8 за 1M входных токенов (image), $5 за 1M (text), $30 за 1M выходных. Кэш: $2 за 1M (image), $1.25 за 1M (text).
Для сравнения, GPT Image 2: $4/$2.50 входные, $15 выходные. Images 2.5 дороже в 2 раза, но быстрее в 2-4 раза и качественнее.
Деловой портрет за 300 токенов. Загрузили селфи сотрудника, выбрали «деловой портрет», получили корпоративное фото без студии. 300 токенов - около 3 ₽ на тарифе «Бизнес». Студия - от 8 000 ₽.
Рекламный креатив за 5 правок. Сгенерировали баннер, потом «поменяй фон на офисный», потом «сделай свет теплее», потом «добавь логотип», потом «убери тени с лица». 5 генераций - 1 500 токенов. Без деградации качества.
Каталог для маркетплейса. 50 товаров, каждому - фото с прозрачным фоном. Загрузили фото на белом фоне, написали «прозрачный фон, студийный свет». 50 генераций - 15 000 токенов. На тарифе «Эксперт» - около 1 500 ₽.
Sketch для баннера. Нарисовали от руки раскладку: заголовок, фото, кнопка. Модель создала готовый баннер по скетчу. Один промпт - один результат.