Если смотреть на происходящее с технической стороны, самое интересное изменение последних двух лет заключается даже не в качестве отдельных генеративных моделей.
Меняется сама архитектура работы с карточкой товара.
Раньше процесс выглядел примерно так:
товар → фотограф → дизайнер → копирайтер → контент-менеджер → маркетплейс
Сейчас между исходными данными о товаре и готовой карточкой постепенно появляется AI-слой:
исходные фото + характеристики товара + требования площадки → анализ → генерация вариантов → проверка → отбор → публикация → данные о результате → новая итерация
Именно последний вариант кажется нам наиболее перспективным.
Генерация ради генерации довольно быстро перестает быть интересной. Возможность сделать красивую фотографию кроссовок на Марсе впечатляет первые несколько раз, но для e-commerce гораздо важнее другой вопрос: поможет ли новый визуал продавать конкретный SKU лучше?
Поэтому генеративные инструменты имеет смысл связывать с аналитическими.
Например:
Исходное изображение
↓ Аудит визуала
↓ Гипотезы для улучшения
↓ AI-фотосессия
↓ AI-инфографика
↓ Несколько вариантов главного изображения
↓ A/B-тест
↓ Выбор варианта
↓ Публикация
↓ CTR / CR / заказы
↓ Следующая итерация
По сути, получается маленький content optimization loop.
И вот здесь AI начинает приносить пользу не потому, что «умеет рисовать», а потому что резко снижает стоимость одной итерации.
На сервисе SellerDen AI этот подход разбит на отдельные инструменты: ИИ- фотосессия, инфографика, видео, аудит изображения, A/B-тест, SEO-генератор и другие модули.
Допустим, у продавца 100 SKU. Для каждого нужно проверить хотя бы:
· два варианта главного изображения;
· два варианта инфографики;
· lifestyle-сцену;
· предметную сцену;
· видео.
Это уже минимум 700 единиц контента. При классическом production pipeline любое масштабирование начинает упираться в деньги и человеческие ресурсы.
У генеративного pipeline другая экономика. Более существенна даже не стоимость одной генерации, а то, что становится экономически возможным сделать пять вариантов там, где раньше сделали бы один.
А затем не спорить внутри команды: «Мне кажется, вот эта фотография выглядит дороже», — а поставить несколько гипотез на тестирование. Это принципиально другой способ производства e-commerce-контента.
Было бы неправильно закончить статью утверждением, что генеративные модели уже полностью заменяют production. Не заменяют. На практике есть несколько классов проблем.
Для e-commerce недостаточно получить красивый объект. Нужно получить тот же самый товар.
У модели есть неприятная склонность «улучшать»:
· форму;
· количество элементов;
· строчки одежды;
· застежки;
· фурнитуру;
· рисунок;
· пропорции;
· логотип;
· надписи.
Для рекламного concept art это может быть несущественно. Для карточки товара — критично. Покупатель должен получить именно тот товар, который увидел.
Поэтому одна из самых сложных задач продуктовой AI-фотографии — не генерация окружения, а identity preservation.
Именно поэтому в SellerDen AI поддерживается загрузка нескольких фотографий товара: дополнительные ракурсы дают модели больше информации о геометрии, фактуре, принтах и конструктивных особенностях объекта.
Diffusion/image-generation модели исторически плохо работали с типографикой. Сейчас ситуация значительно лучше, но задача все равно нетривиальная.
Для маркетплейса ошибка вида «100% хлопок» → «100% хлопк» — это уже не эстетический дефект.
Поэтому генерация инфографики требует отдельного контроля:
LLM
↓ структура сообщения
↓ визуальная композиция
↓ image generation
↓ проверка текста
↓ готовая карточка
То есть хорошая AI-инфографика — это не просто prompt → image.
Особенно хорошо проблема проявляется в fashion. Модель может великолепно сгенерировать человека и при этом добавить палец, изменить кисть, неправильно расположить ремень сумки, деформировать обувь или изменить посадку одежды.
Чем сильнее товар взаимодействует с человеком, тем выше вероятность ошибки. Поэтому изображения «товар на модели» требуют более строгой проверки, чем классическая предметная съемка.
В видео появляется следующий уровень сложности. Если изображение должно быть корректно в одной временной точке, видео должно сохранять эту корректность на протяжении всей последовательности.
Модель должна удерживать:
product identity + geometry + texture + lighting + motion + temporal consistency
Именно поэтому короткие controlled motions часто работают лучше сложных сцен. Например, «камера медленно приближается к флакону» обычно значительно стабильнее, чем многошаговое действие с моделью, предметом и перемещением по сцене.
Чем больше независимых действий появляется в сцене, тем выше вероятность temporal artifacts.
Мы не считаем хорошей архитектуру:
AI → marketplace
Гораздо надежнее:
AI → validation → human approval → marketplace
Особенно когда речь идет о характеристиках товара.
Человек должен проверить:
· совпадает ли товар;
· не изменились ли конструктивные элементы;
· правильно ли написан текст;
· соответствует ли изображение реальности;
· нет ли визуально красивых, но ложных обещаний;
· соответствует ли контент требованиям площадки.
Для коммерческого AI human-in-the-loop — нормальная часть архитектуры.
Сейчас большинство AI-инструментов устроены по модели: человек выбирает инструмент → задает параметры → получает результат.
Но логичный следующий шаг выглядит иначе. Пользователь загружает несколько фотографий товара, название, характеристики, категорию и маркетплейс.
Дальше система сама строит workflow:
Определить товар
↓ Определить категорию
↓ Проанализировать исходный визуал
↓ Найти слабые места
↓ Сформировать visual strategy
↓ Создать hero image
↓ Создать lifestyle
↓ Создать detail shot
↓ Создать инфографику
↓ Создать видео
↓ Сформировать SEO
↓ Проверить комплект
↓ Предложить варианты для тестирования
Человек уже не работает отдельно с пятью нейросетями. Он ставит бизнес-задачу: «Подготовь карточку этого товара для Ozon». А orchestration layer сам определяет, какие модели и инструменты использовать.
С инженерной точки зрения именно orchestration, а не очередная генеративная модель, кажется одним из самых интересных направлений развития таких продуктов.
Еще интереснее станет, когда pipeline замкнется на реальные данные маркетплейса.
AI создал 4 hero images
↓ варианты опубликованы
↓ система получает CTR
↓ определяет победителя
↓ анализирует причины
↓ строит новые гипотезы
↓ генерирует следующую итерацию
Тогда мы переходим от generative AI к optimization AI.
AI уже не просто производит контент. Он участвует в цикле: гипотеза → генерация → эксперимент → данные → новая гипотеза.
Для e-commerce это гораздо более важный сценарий, чем бесконечное улучшение качества одной картинки.
Если убрать весь AI-хайп, остается довольно прагматичная вещь: раньше стоимость проверки новой визуальной гипотезы была высокой.
Чтобы понять, лучше ли выглядит товар на модели, в интерьере, на белом фоне, с инфографикой или в lifestyle-сцене, нужно было физически произвести несколько вариантов контента.
Теперь стоимость эксперимента резко снижается. И это меняет саму стратегию работы с карточкой.
Не обязательно пытаться придумать идеальное главное фото. Можно сделать десять разумных вариантов, отсеять плохие, проверить несколько сильных и оставить тот, который лучше работает на реальной аудитории.
То же самое касается инфографики, видео, SEO, ответов на отзывы, визуальных сценариев и позиционирования товара.
Поэтому главный эффект AI для маркетплейсов заключается не в том, что он «заменяет дизайнера». Он превращает производство контента из относительно дорогого единичного процесса в итеративную систему экспериментов.
Мы бы вообще не ставили вопрос таким образом.
Фотограф умеет придумать сильную концепцию. Дизайнер понимает визуальную иерархию. Маркетолог понимает аудиторию. Контент-менеджер знает требования площадки. Селлер знает экономику своего SKU.
AI хорош в другом: он позволяет дешево и быстро материализовать гипотезу.
Именно поэтому наиболее жизнеспособной кажется связка:
эксперт → AI → данные → эксперт
Человек задает направление. AI производит варианты. Данные показывают результат. Человек принимает следующее решение. И цикл повторяется.
· Первое: универсального промпта не существует. Чем больше контекста система получает о товаре, площадке и задаче, тем стабильнее результат.
· Второе: для e-commerce preservation важнее creativity. Красивое изображение неправильного товара бесполезно.
· Третье: разные задачи требуют разных pipelines. Аудит фотографии, генерация SEO, фотосессия и image-to-video — это не четыре интерфейса над одной LLM.
· Четвертое: референс часто является более точным способом управления генерацией, чем длинное текстовое описание.
· Пятое: автоматическая генерация без validation layer опасна. Особенно для характеристик товара, текста и изображений на модели.
· Шестое: самое большое преимущество AI появляется не при создании одного изображения, а при массовом тестировании вариантов.
· Седьмое: конечная единица продукта — уже не «генерация». Это готовая карточка товара и измеримый результат ее работы.
Сервис SellerDen AI объединяет в одном контуре генерацию инфографики, AI-фотосессии, видео из изображения, аудит фотографий, A/B-тестирование, SEO-описания и несколько вспомогательных AI-инструментов.
Но технически гораздо интереснее двигаться от набора отдельных генераторов к системе, которая понимает весь жизненный цикл карточки:
увидела исходник → нашла проблему → предложила гипотезу → создала контент → помогла проверить результат
И если несколько лет назад вопрос звучал: «Может ли нейросеть написать описание товара?», то сейчас он уже другой:
«Какую часть операционного цикла e-commerce можно превратить в управляемый AI-pipeline?»
Похоже, ответ будет постепенно приближаться к слову «почти всю».
Но только при одном условии: мы перестанем относиться к AI как к волшебной кнопке «сгенерировать» и начнем проектировать вокруг него нормальные инженерные процессы — с контекстом, ограничениями, валидацией, экспериментами и обратной связью.
Именно там начинается действительно интересная часть AI в e-commerce.