Ещё недавно обработка фотографии с помощью нейросети чаще всего сводилась к генеративной заливке отдельного участка изображения. Пользователь выделял область, задавал запрос, а затем вручную исправлял получившиеся границы и артефакты. В 2026 году подход изменился: современные ИИ-модели способны работать с фотографией практически как полноценные редакторы.
Теперь достаточно загрузить снимок и описать обычными словами, что именно нужно изменить: например, заменить фон на заснеженный лес, убрать случайного человека или сделать кожу более естественной. Нейросеть анализирует исходное изображение и старается изменить только указанные элементы, сохраняя композицию, освещение и остальные детали кадра.
Все модели из обзора собраны в агрегаторе STIVA.ai. Нейросети доступны на русском языке, для использования не нужны VPN и зарубежные карты, новым пользователям дают 100 приветственных токенов.
Nano Banana 2 — универсальный инструмент Google, который хорошо подходит для редактирования настоящих фотографий. Все основные изменения можно задавать обычным текстом: например, попросить поменять одежду, переместить объект, очистить фон или изменить цвет стены.
При этом модель старается сохранять исходную композицию, освещение и перспективу. Она поддерживает до 10 референсов объектов и до 4 референсов персонажа, а последовательное редактирование можно выполнять без заметной деградации результата.
Доступно разрешение от 0.5K до 4K. Стоимость составляет примерно $0.067 за изображение в 1K и $0.151 за 4K. Генерация обычно занимает около 4–6 секунд.
К ограничениям относятся невидимый водяной знак SynthID. Кроме того, сложные надписи и типографику после генерации желательно дополнительно проверять и при необходимости корректировать вручную.
Nano Banana Pro — более продвинутая версия семейства, ориентированная прежде всего на точность, а не просто на улучшение визуального качества.
Модель лучше справляется со сложной вёрсткой, многострочными надписями, повторяющимися элементами бренда и сценами с большим количеством объектов. Она также стабильнее сохраняет внешность персонажа при использовании изображения в серии разных материалов.
Количество референсов зависит от типа: можно использовать до 6 изображений объектов, до 5 изображений персонажей и до 3 стилевых референсов. Разрешение результата — от 1K до 4K.
Более высокая точность требует дополнительных ресурсов: генерация занимает больше времени, а стоимость составляет примерно $0.134 за кадр 1K–2K и $0.24 за изображение в 4K.
Поэтому Nano Banana Pro логичнее использовать для финальной подготовки рекламных, брендовых и других ответственных материалов, а не для массового создания контента.
Nano Banana Lite — самая доступная и быстрая модель семейства. Её основная задача — обработка большого количества изображений: создание черновиков, превью и однотипных карточек.
Обработка изображения 1K занимает около 4 секунд, а стоимость составляет примерно $0.034 за кадр — примерно в два раза дешевле Nano Banana 2.
Модель поддерживает полноценное редактирование, но хуже подходит для большого количества референсов и длинных цепочек последовательных изменений. Максимальное разрешение ограничено 1K.
Практичный вариант использования — сначала обработать большую партию через Lite, выбрать лучшие результаты, а затем провести финальную обработку в Nano Banana 2 или увеличить разрешение с помощью апскейлера.
GPT Image 2.5 была представлена 8 сентября 2026 года и позиционируется как модель, ориентированная непосредственно на редактирование изображений.
В линейке предусмотрено два режима: Flare отвечает за более быструю обработку, а Sunburst делает акцент на качестве и точности.
Ключевое преимущество модели — способность ограничивать изменения областью, которую указал пользователь. При этом она старается сохранять единый визуальный стиль и внешность персонажей даже после десятков последовательных правок.
Поддерживаются инпейнтинг, до 16 референсов, очень длинные промпты объёмом до 20 000 символов, разрешения от 1K до 4K и прозрачный фон.
Стоимость осталась на уровне $8 за миллион входных изображений. Для работы с документальными и профессиональными материалами также важны C2PA-метаданные и невидимый водяной знак.
GPT Image 2 — предыдущее поколение OpenAI, которое всё ещё остаётся востребованным в отдельных сценариях и в некоторых задачах способно конкурировать с более новой версией 2.5.
Авторегрессионная архитектура позволяет модели воспринимать запрос как контекст. Благодаря этому длинные инструкции и сложные элементы вёрстки сохраняются достаточно стабильно.
Главная специализация — редактирование фотографий с большим количеством текста: баннеров, упаковки, витрин, постеров и других материалов, где важно не разрушить исходную типографику.
Модель поддерживает до 16 референсов, разрешение 4K и около 99% точности работы с текстом. Кроме того, доступен более широкий выбор соотношений сторон.
В большинстве интерфейсов GPT Image 2 стоит дешевле, чем новые модели, и уже интегрирована в существующие рабочие процессы.
Seedream 4.5 — флагман ByteDance, ориентированный на получение максимально естественной и качественной картинки.
В ситуациях, когда итоговая фотография не должна выглядеть как результат работы ИИ, модель часто показывает себя особенно хорошо. Она принимает исходное изображение и до 10 референсов, умеет менять фон, освещение и материалы, сохраняя основной объект.
Сильные стороны Seedream 4.5 — реалистичная кожа, волосы, ткани, естественный студийный свет и работа с мелкими надписями. Нативное разрешение достигает 4K.
Стоимость составляет примерно $0.036 за изображение.
При этом здесь нет интерактивных выделений и полноценной работы со слоями, а серьёзное изменение изображения выполняется через пересборку кадра. Модель хорошо подходит для маркетплейсов, лукбуков и портретной фотографии.
Seedream 5 Pro появилась 8 июля 2026 года и сделала акцент на принципе «изменять только то, что указал пользователь».
Для этого предусмотрены интерактивные инструменты: лассо, рамка, набросок, пипетка и выбор референса материала. Ещё одна важная функция — разделение результата на отдельные слои.
Можно получить фон и до 20 независимо редактируемых прозрачных PNG-слоёв.
Максимальное разрешение составляет 2K–3K, тогда как у Seedream 4.5 оно достигает 4K. Стоимость выше — около $0.054 за изображение.
На старте модель уступала 4.5 в качестве проработки лиц и использовала более строгую модерацию. Поэтому Seedream 5 Pro чаще выбирают именно ради интерактивного редактирования и работы со слоями.
Seedream 5 Lite — облегчённая версия пятого поколения ByteDance, в которой основной упор сделан на рассуждение и работу с инструкциями.
Здесь появились два интересных сценария, которых нет в Seedream 4.5. Первый — редактирование по абстрактному намерению. Пользователь может написать что-то вроде «сделай изображение дороже» или «приведи его к журнальному стилю», не перечисляя конкретные изменения.
Второй режим работает по принципу «было → стало»: модель анализирует пример преобразования и может переносить аналогичную обработку на большое количество фотографий.
Поддерживается до 14 референсов и разрешение до 2K.
Компромисс заключается в качестве отдельных деталей: материалы могут выглядеть немного плоско, а мелкий плотный текст иногда искажается. Поэтому модель особенно хорошо подходит для черновой обработки и контента для социальных сетей.
FLUX.2 Pro — производственный инструмент Black Forest Labs, рассчитанный в том числе на использование через код.
Для редактирования предусмотрен отдельный endpoint, который способен объединять до 9 референсов. Их можно прямо указывать в текстовой инструкции, например попросить взять человека с первой картинки и одежду с четвёртой.
При этом не нужны маски и сложная ручная настройка параметров.
FLUX.2 Pro ориентирована на фотографическое качество: модель хорошо скрывает стыки и точно работает с цветами. Стоимость начинается примерно от $0.03 за первый мегапиксель и $0.015 за каждый следующий. Поэтому работа с изображениями в 4K обходится дороже, чем у некоторых конкурентов.
FLUX.2 Klein — компактная линейка моделей на 4B и 9B параметров, рассчитанная на максимально быстрый цикл редактирования.
Основной сценарий выглядит просто: загрузить изображение, внести изменение и практически сразу оценить результат.
Модель объединяет три задачи в одной архитектуре и поддерживает до 4 референсов. На мощных GPU отклик занимает доли секунды, а на RTX 3060/4060 — примерно 2–5 секунд.
Важное преимущество — открытые веса. Версия 4B распространяется по лицензии Apache 2.0, может запускаться локально и поддерживается ComfyUI.
Стоимость начинается примерно от $0.014 за изображение, что делает FLUX.2 Klein самым доступным вариантом в семействе.
При этом по микродеталям и работе с большим количеством мелкого текста модель уступает FLUX.2 Pro и Max.
Qwen Image 3 делает акцент не столько на визуальной красоте, сколько на точном понимании инструкции и содержательной обработке изображения.
Максимальная длина инструкции составляет до 4500 токенов — примерно в 4,5 раза больше, чем у версии 2.0.
У модели можно выделить три основных направления работы. Первое — замена текста непосредственно внутри изображения с сохранением шрифта и перспективы. Второе — семантическое редактирование объектов с использованием от одного до трёх референсов. Третье — восстановление повреждённых изображений с сохранением исходной композиции и характера мазка.
Также поддерживается панорамное расширение кадра.
Максимальное разрешение составляет 2048×2048. При этом веса модели закрыты, а собственные результаты бенчмарков производитель не публиковал.
Wan 2.7 Image объединяет генерацию и редактирование изображения и предлагает два особенно интересных режима.
В Thinking mode модель сначала анализирует запрос и композицию, а затем формирует результат. Второй вариант — интерактивное редактирование выделенной области: можно переместить или заменить конкретный объект вплоть до попиксельной обработки.
При этом всё, что пользователь не указал в инструкции, модель старается оставить без изменений.
WAN 2.7 Image поддерживает до 9 входных изображений, умеет извлекать цветовую палитру и предлагает тонкую настройку персонажей.
Стандартная версия работает в 2K, Pro — до 4K. На данный момент модель доступна только через облако и API.
Grok Imagine основана на модели Imagine Image 2.0 и используется в Quality Mode сервиса Grok.
Работа начинается с уже существующего изображения. Можно удалить людей, предметы или надписи, заменить фон, изменить цвет одежды, скорректировать освещение или повернуть объект в другом направлении.
Поддерживается до 5 референсов. Разрешение результата составляет 1K–2K.
Дополнительные инструменты включают «волшебную палочку» для сегментации и Smart Resize для изменения формата изображения.
Качество зависит от выбранного тарифа и региона. Часть запросов ограничивается модерацией. По детализации кожи Grok Imagine уступает таким решениям, как Seedream 4.5 и Nano Banana Pro.
Midjourney долгое время воспринимался исключительно как генератор изображений, однако 27 августа 2026 года в версии V8.2 появилась отдельная Edit Model.
Она позволяет изменять готовое изображение с помощью текстовых инструкций, использовать до 4 референсов, применять кистевой инпейнтинг и аутпейнтинг.
Также фотографию можно преобразовать в набросок или стилизованную живопись.
Для вызова режима используется добавление --edit к промпту.
При этом Midjourney остаётся скорее эстетическим, чем хирургически точным редактором. Если инструкция сформулирована слишком расплывчато, модель может затронуть соседние элементы. Ещё одно ограничение — после редактирования HD-изображение снижается до стандартного разрешения.
FeyNoBg — открытая модель на базе архитектуры BiRefNet, которая решает одну конкретную задачу: удаление фона.
В отличие от большинства инструментов в этом обзоре, ей вообще не требуется текстовый промпт. Пользователь загружает изображение и получает объект на прозрачном PNG.
Основное преимущество — высокая точность сегментации. Модель занимает первое место на четырёх из восьми профильных бенчмарков и корректно работает даже с изображениями в 4K и 8K.
FeyNoBg ничего не дорисовывает, а значит, исходные пиксели объекта остаются без генеративной замены. Это особенно важно для товарных каталогов.
Модель хорошо справляется с волосами, мехом, проводами и другими сложными элементами, на которых простые сегментаторы часто ошибаются.
Topaz Image Upscale — не генеративный редактор, а восстановительная модель из семейства Gigapixel от Topaz Labs.
Её основная задача — увеличить разрешение и улучшить чёткость изображения, не изменяя его содержание. Поддерживается увеличение до 512 мегапикселей при исходном размере до 32MP.
Есть отдельные пресеты для фотографий, арта, CGI и сканов. Пользователь может регулировать уровень детализации и шумоподавления.
В отличие от генеративных моделей, Topaz не придумывает новые элементы сцены. Он нужен для подготовки изображения к печати, увеличения разрешения и устранения эффекта «мыла».
Удалить человека, заменить фон или изменить предмет с его помощью нельзя — для таких задач потребуется генеративный редактор.
Помимо основных решений, есть ещё несколько моделей, которые способны работать с готовыми фотографиями.
Оригинальный Nano Banana (Gemini 2.5 Flash Image) остаётся простым и достаточно надёжным редактором с разрешением до 1024 px. Сейчас Google уже относит его к legacy.
Qwen Image 2 — открытая модель на 7B параметров с нативным 2K, которую можно рассматривать как вариант для локального запуска вместо третьей версии.
Z Image и Z Image Turbo ориентированы на быстрые и недорогие изменения стиля, объектов и фона с сохранением исходной композиции. Однако ограничение примерно в 1024 px делает их скорее инструментами для черновой работы.
Наконец, GPT Image 1.5 — предыдущая модель OpenAI. Сейчас её в основном выбирают в тех случаях, когда при массовой обработке важна экономия.
Выбор модели напрямую зависит от того, какую именно задачу необходимо решить.
Для точечной замены объектов, одежды или фона подойдут GPT Image 2.5 Sunburst, Nano Banana 2 и Seedream 5 Pro.
Если главная задача — ретушь портрета с сохранением естественной текстуры кожи, стоит обратить внимание на Seedream 4.5. Для получения максимально естественного лица можно сочетать генеративную обработку с последующим использованием Topaz.
Для замены фона товара и подготовки коммерческих фотографий оптимальны Seedream 4.5 или FLUX.2 Pro.
Если изображение содержит большое количество текста — например, это плакат, упаковка или рекламный баннер, — лучше рассмотреть Qwen Image 3 или GPT Image 2.
Для быстрых черновиков подойдут FLUX.2 Klein и Nano Banana Lite. Если требуется только удалить фон, удобнее использовать FeyNoBg. А для финального повышения разрешения — Topaz Image Upscale.
Если фотография предназначена для печати, стоит выбирать модели с нативным 4K: Seedream 4.5, Nano Banana 2, GPT Image 2.5 или FLUX.2 Pro.
По стоимости ориентиры начинаются примерно с $0.014 за кадр у FLUX.2 Klein и составляют около $0.034–0.036 у Nano Banana Lite и Seedream 4.5. Премиальные режимы могут стоить примерно $0.054–0.134 за изображение.
При работе с большим объёмом данных и чувствительной информацией стоит отдельно учитывать возможность локального запуска. FLUX.2 Klein 4B и FeyNoBg можно использовать на собственном GPU, тогда как Nano Banana, GPT Image и Qwen относятся к закрытым моделям.
В 2026 году для полноценной обработки фотографий уже недостаточно ориентироваться на один универсальный ИИ-сервис. Практичнее собрать набор инструментов под разные этапы работы.
В качестве основного редактора, который понимает текстовые инструкции и умеет сохранять идентичность объектов, можно рассматривать Nano Banana 2, GPT Image 2.5 или Seedream 4.5.
Для максимально точного вмешательства в отдельную область изображения пригодятся Seedream 5 Pro, WAN 2.7 Image и Midjourney.
Если важны скорость и низкая стоимость при обработке большого количества файлов, стоит обратить внимание на FLUX.2 Klein и Nano Banana Lite.
Для технических задач, где промпт вообще не нужен, полезны два специализированных инструмента: FeyNoBg для удаления фона и Topaz Image Upscale для увеличения разрешения и повышения качества.
Главный практический принцип при работе с современными ИИ-редакторами — не пытаться изменить фотографию целиком одним запросом. Лучше разбить процесс на отдельные этапы: сначала обработать фон, затем объекты, после этого свет и текст, а увеличение разрешения выполнить отдельной финальной операцией.