Обработка фотографий с помощью ИИ за последние пару лет сильно изменилась. Раньше нейросеть в основном умела дорисовать выделенную область, а пользователю всё равно приходилось вручную исправлять артефакты и границы. Сейчас достаточно загрузить снимок и написать, что именно нужно изменить.
Например: «замени фон на заснеженный лес, но сохрани освещение на лице», «убери человека справа» или «сделай кожу более живой, но без эффекта пластика». Современные модели способны изменить конкретный элемент, сохранив композицию и остальные детали кадра. К этому классу инструментов относятся Nano Banana, GPT Image, Seedream, FLUX.2, Qwen Image и WAN. Они объединяют генерацию и редактирование изображений и позволяют использовать несколько референсов одновременно — в зависимости от модели от 3 до 16 изображений.
Все модели из этого обзора собраны в агрегаторе STIVA.ai. Нейросети поддерживают русский язык, для работы не требуются VPN и зарубежные банковские карты, а новым пользователям начисляют 100 приветственных токенов.
В список попали именно те модели, которые могут взять готовую фотографию и изменить её по текстовой инструкции. То есть речь не просто о генерации картинки по промпту, а о полноценном редактировании исходника.
Nano Banana 2 можно назвать универсальным вариантом для повседневной работы с фотографиями. Модель хорошо понимает обычные текстовые команды: можно поменять одежду, переставить предмет, очистить фон или изменить цвет стены.
При этом Nano Banana 2 старается сохранить исходную композицию, перспективу и освещение. Можно загрузить до 10 референсов объектов и до 4 референсов персонажа. Поддерживаются последовательные правки — результат не должен заметно деградировать после нескольких итераций.
Разрешение варьируется от 0.5K до 4K. Ориентировочная стоимость составляет около $0.067 за 1K и $0.151 за 4K, а обработка обычно занимает 4–6 секунд.
Из нюансов — невидимая маркировка SynthID. Кроме того, если на изображении много сложного текста, результат лучше проверить вручную.
Nano Banana Pro — более продвинутая версия семейства. Здесь ставка сделана прежде всего на точность, а не на максимальную скорость.
Модель лучше справляется со сложной композицией, плотной вёрсткой, многострочными надписями и повторяющимися элементами бренда. Ещё один плюс — стабильное сохранение внешности персонажа при подготовке серии изображений.
С референсами тоже всё серьёзно: поддерживается до 6 объектовых, 5 персонажных и 3 стилевых изображений. Выходное разрешение — от 1K до 4K.
Цена выше: примерно $0.134 за кадр в разрешении 1K–2K и $0.24 за 4K. Поэтому использовать Nano Banana Pro для массового производства контента не всегда рационально. Зато для финальных рекламных макетов и брендовых материалов возможности модели выглядят особенно интересно.
Nano Banana Lite — вариант для тех случаев, когда главное не максимальное качество, а скорость и стоимость.
Модель рассчитана на большие объёмы: черновики, превью, каталожные карточки и другие однотипные изображения. Кадр в 1K обрабатывается примерно за 4 секунды, а стоимость составляет около $0.034 — примерно в два раза дешевле Nano Banana 2.
При этом возможности редактирования остаются полноценными. Но Lite хуже подходит для большого количества референсов и длинных цепочек правок, а максимальное разрешение ограничено 1K.
Практичный сценарий выглядит так: сначала прогнать всю партию через Lite, выбрать удачные варианты, а затем лучшие изображения доработать с помощью Nano Banana 2 или увеличить через 4K-апскейл.
GPT Image 2.5 появилась 8 сентября 2026 года и сделала заметный акцент именно на редактировании изображений.
В модели предусмотрено два режима: Flare — более быстрый вариант для обычных задач, и Sunburst — режим, ориентированный на качество и точность. Основной принцип работы простой: модель старается менять только тот участок, который пользователь указал в запросе.
GPT Image 2.5 умеет работать с инпейнтингом, принимает до 16 референсов, поддерживает промпты длиной до 20 000 символов и умеет выдавать изображения от 1K до 4K. Есть и прозрачный фон.
Стоимость осталась на прежнем уровне — около $8 за миллион входных изображений. Для документов и коммерческих материалов дополнительно важны C2PA-метаданные и невидимый водяной знак.
Несмотря на выход новой версии, GPT Image 2 всё ещё может быть полезна. В некоторых сценариях предыдущее поколение даже оказывается удобнее.
Авторегрессионный подход позволяет модели воспринимать длинный запрос как единый контекст. Благодаря этому она хорошо справляется с макетами и изображениями, где присутствует много текста.
Особенно интересно это для баннеров, упаковки, постеров и витрин: при внесении изменений модель старается не разрушить существующую типографику.
Поддерживается до 16 референсов и разрешение до 4K. Точность работы с текстом заявляется на уровне около 99%, а диапазон соотношений сторон достаточно широкий.
При этом в большинстве интерфейсов модель обходится дешевле и уже может быть встроена в существующие рабочие процессы.
Seedream 4.5 от ByteDance делает ставку на максимально естественный результат. Если после обработки фотография должна выглядеть так, будто её вообще не редактировали, модель заслуживает внимания.
Она принимает исходное изображение и до 10 референсов, позволяет менять фон, освещение и материалы, стараясь сохранить исходный объект.
Сильная сторона Seedream 4.5 — работа с деталями: кожа, волосы, ткань, фактуры и студийное освещение выглядят достаточно естественно. Хорошо модель справляется и с небольшим текстом.
Нативное разрешение достигает 4K, стоимость — примерно $0.036 за изображение.
Главный минус — отсутствие интерактивных выделений и привычной работы со слоями. При масштабной правке кадр фактически пересобирается.
Модель особенно хорошо подходит для маркетплейсов, лукбуков, рекламных фотографий и портретов.
Seedream 5 Pro вышла 8 июля 2026 года и предлагает другой подход к редактированию: пользователь может более точно указать, какую часть изображения нужно изменить.
В распоряжении есть интерактивные инструменты — лассо, рамка, набросок, пипетка и выбор референса материала.
Особенно интересна возможность работы со слоями. Фон можно отделить, а результат разбить на до 20 независимо редактируемых прозрачных PNG.
При этом максимальное разрешение ниже, чем у Seedream 4.5: примерно 2K–3K против 4K. Цена составляет около $0.054 за изображение.
На старте модель уступала 4.5 в некоторых задачах с лицами, а модерация была более строгой. Поэтому основной причиной выбрать 5 Pro остаётся именно более детальный контроль над отдельными элементами и слоями.
Seedream 5 Lite — облегчённая версия пятого поколения ByteDance, где больше внимания уделено рассуждению и пониманию задачи.
У модели есть два интересных режима. Первый позволяет описать желаемое изменение довольно абстрактно — например, попросить сделать изображение «дороже» или придать ему журнальную эстетику. Второй переносит преобразование из формата «было → стало» сразу на серию фотографий.
Поддерживается до 14 референсов, максимальное разрешение — 2K.
Компромиссы тоже есть: материалы иногда выглядят чуть менее объёмными, а мелкий плотный текст может искажаться. Поэтому модель логичнее использовать для черновиков, соцсетей и быстрых вариантов, а не для финальных макетов.
FLUX.2 Pro от Black Forest Labs ориентирована прежде всего на производственные сценарии и работу через код.
Модель умеет объединять до 9 референсов и обращаться к ним непосредственно в текстовой инструкции. Например, можно попросить взять человека с первого изображения, а одежду — с четвёртого.
При этом не обязательно использовать маски и вручную настраивать параметры. Качество изображения остаётся фотографическим, а переходы между элементами выглядят естественно.
Стоимость начинается примерно с $0.03 за первый мегапиксель и $0.015 за каждый последующий. Поэтому на 4K итоговая цена может оказаться выше, чем у некоторых конкурентов.
FLUX.2 Klein — компактное семейство моделей на 4B и 9B параметров. Его основная идея — максимально быстрый цикл редактирования: загрузили фотографию, внесли изменения, сразу посмотрели результат.
Поддерживается до 4 референсов, а сама модель объединяет сразу три задачи в одной архитектуре.
На мощных GPU отклик занимает доли секунды, а на видеокартах уровня RTX 3060/4060 обработка занимает примерно 2–5 секунд.
Ещё один важный плюс — открытые веса. Версия 4B распространяется под Apache 2.0 и может запускаться локально, в том числе через ComfyUI.
Стоимость начинается примерно от $0.014 за изображение. Это один из самых доступных вариантов в подборке.
Но по мелким деталям и сложному тексту Klein всё же уступает более дорогим версиям Pro и Max.
Qwen Image 3 интересна прежде всего не «улучшением красоты», а редактированием содержания изображения.
Модель принимает инструкции длиной до 4500 токенов — это примерно в 4,5 раза больше, чем у Qwen Image 2.0.
Здесь сразу несколько полезных сценариев: можно менять текст внутри изображения с сохранением шрифта и перспективы, редактировать объекты по одному-трём референсам и восстанавливать повреждённые фотографии, стараясь сохранить исходную композицию и характер изображения.
Есть и функция панорамизации.
Максимальное разрешение — 2048×2048. При этом веса модели закрыты, а собственных бенчмарков от разработчика пока нет.
Wan 2.7 Image объединяет генерацию и редактирование изображений.
Одна из интересных функций — Thinking mode. Сначала модель анализирует промпт и композицию, а затем формирует изображение.
Для точечной работы есть интерактивное редактирование: выделенную область можно перемещать или заменять, вплоть до очень точного редактирования. При этом элементы, которые пользователь не упоминал, должны оставаться без изменений.
Поддерживается до 9 входных изображений, есть извлечение палитры и тонкая настройка внешности персонажа.
В стандартном варианте максимальное разрешение составляет 2K, в Pro — до 4K.
Пока модель доступна только через облачные сервисы и API.
Grok Imagine — модель Imagine Image 2.0, которая используется в Quality Mode внутри Grok.
Работа начинается с готовой фотографии. Можно убрать человека или предмет, заменить фон, изменить цвет одежды, поправить освещение или задать объекту другой ракурс.
Поддерживается до 5 референсов. Разрешение — от 1K до 2K.
Есть «волшебная палочка» для сегментации и Smart Resize, который помогает адаптировать изображение под другой формат.
Однако результат зависит от выбранного тарифа и региона. Кроме того, часть запросов может блокироваться модерацией. В работе с кожей и мелкими фактурами модель уступает некоторым конкурентам, например Seedream 4.5 и Nano Banana Pro.
Midjourney долго воспринималась прежде всего как генератор изображений. Но 27 августа 2026 года в V8.2 появилась Edit Model.
Теперь изображение можно редактировать с помощью текстовой команды. Модель умеет работать с четырьмя референсами, поддерживает кистевой инпейнтинг и аутпейнтинг, а также позволяет превращать фотографию в набросок или картину.
Для вызова используется добавка —edit к промпту.
При этом Midjourney скорее про визуальную эстетику, чем про хирургически точную обработку. Если инструкция сформулирована слишком расплывчато, модель может затронуть соседние элементы. Кроме того, при редактировании HD-изображение переводится в стандартное разрешение.
FeyNoBg заметно отличается от остальных моделей. Здесь вообще не нужен промпт: загружаете изображение, и нейросеть автоматически отделяет объект от фона, выдавая прозрачный PNG.
Модель построена на архитектуре BiRefNet и делает ставку именно на точность вырезания.
Она хорошо работает с изображениями в 4K и 8K и показывает высокие результаты на профильных бенчмарках.
Главное преимущество для каталогов и интернет-магазинов — модель ничего не дорисовывает. Исходные пиксели объекта сохраняются, а нейросеть занимается только отделением фона.
Особенно полезна она в сложных случаях: волосы, мех, провода и другие детали, на которых обычные сегментаторы часто ошибаются.
Topaz Image Upscale работает по другому принципу. Это не генеративная модель, а инструмент восстановления и увеличения изображения из семейства Gigapixel от Topaz Labs.
Он повышает разрешение и детализацию, не пытаясь придумать новую сцену. Поддерживаются изображения до 512 мегапикселей при исходнике размером до 32 MP.
Есть пресеты для фотографий, арта, CGI и сканов, а также настройки детализации и шумоподавления.
Если генеративная нейросеть может изменить фон или убрать человека, Topaz решает другую задачу — помогает довести уже готовый кадр до качества, подходящего для печати или крупного размещения.
Помимо основных участников обзора, есть ещё несколько моделей, которые способны работать с готовыми фотографиями.
Оригинальный Nano Banana (Gemini 2.5 Flash Image) остаётся простым и достаточно надёжным редактором с максимальным выводом 1024 px. Сейчас Google уже относит его к legacy.
Qwen Image 2 — открытая модель на 7B параметров с нативным 2K. Её можно рассматривать как вариант для локального запуска вместо третьей версии.
Z Image и Z Image Turbo рассчитаны на быструю и недорогую обработку. Они могут менять стиль, фон и отдельные объекты, стараясь сохранить исходную композицию. Но разрешение примерно 1024 px скорее делает их инструментами для черновой работы.
Наконец, GPT Image 1.5 — предыдущее поколение OpenAI. Сейчас её основной аргумент — возможность сэкономить при обработке большого количества изображений.
Универсального варианта на все случаи жизни здесь нет — всё зависит от конкретной задачи.
Для точечной замены предметов, одежды или фона можно обратить внимание на GPT Image 2.5 Sunburst, Nano Banana 2 и Seedream 5 Pro.
Если задача — ретушь портрета с сохранением естественной кожи, интересны Seedream 4.5 и связка генеративного редактора с Topaz. Для переноса товара на новый фон подойдут Seedream 4.5 и FLUX.2 Pro.
Когда на изображении много надписей, упаковки или рекламной типографики, стоит посмотреть на Qwen Image 3 и GPT Image 2.
Для быстрых черновиков логично использовать FLUX.2 Klein или Nano Banana Lite. Фон проще всего отделять через FeyNoBg, а финальное увеличение разрешения отдавать Topaz Image Upscale.
Если критично именно 4K, среди подходящих вариантов — Seedream 4.5, Nano Banana 2, GPT Image 2.5 и FLUX.2 Pro.
По стоимости разброс достаточно большой: примерно от $0.014 за изображение у FLUX.2 Klein до $0.034–0.036 у Nano Banana Lite и Seedream 4.5 и примерно $0.054–0.134 у более дорогих режимов.
Для больших объёмов и работы с чувствительными данными отдельный интерес представляют модели, которые можно запускать локально. Например, FLUX.2 Klein 4B и FeyNoBg позволяют работать на собственном GPU, тогда как Nano Banana, GPT Image и Qwen относятся к закрытым решениям.
В 2026 году для полноценной обработки фотографий уже не обязательно искать одну «идеальную» нейросеть. Гораздо практичнее собрать небольшой набор инструментов под разные этапы работы.
В качестве основного редактора можно использовать Nano Banana 2, GPT Image 2.5 или Seedream 4.5. Когда требуется максимально точно воздействовать на конкретный участок изображения, пригодятся Seedream 5 Pro, WAN 2.7 Image или Midjourney.
Для больших объёмов и быстрых черновиков подойдут FLUX.2 Klein и Nano Banana Lite. А специализированные FeyNoBg и Topaz Image Upscale закрывают две технические задачи — удаление фона и повышение разрешения.
И ещё один практический совет: не стоит пытаться изменить фотографию целиком одним огромным промптом. Лучше разбить работу на несколько этапов — отдельно поправить фон, затем объект, освещение и текст, а апскейл выполнить в самом конце.
Такой подход обычно даёт больше контроля и позволяет быстрее заметить ошибки на каждом этапе.