Когда мы называем стоимость ИИ-ролика, клиент иногда делает небольшую паузу. А потом спрашивает: «Почему 20 секунд стоят 30 тысяч? Это же делает нейросеть».
Я не считаю этот вопрос глупым или обидным. Со стороны процесс действительно выглядит примерно так: написал запрос, нажал “сгенерировать” и через несколько минут получил видео. И, кажется, что где-то здесь продакшн сильно переоценивает свою работу.
Но когда начинаешь видеть весь процесс, а не только удачный ролик в портфолио, вопрос звучит уже иначе: сколько попыток, людей и часов потребовалось, чтобы эти 20 секунд можно было выпустить от имени бренда?
Меня зовут Татьяна Шикалова, я CEO Studio :We. Сама я не занимаюсь генерациями, зато вижу каждый проект целиком: от первого разговора с клиентом и расчета сметы до финального ролика. Я знаю, сколько промежуточных версий остается за кадром, почему на одну сцену может уйти несколько часов и в какой момент небольшая правка превращается в новую генерацию. Моя задача — сделать этот процесс понятным и управляемым для клиента.
Поэтому расскажу, за что на самом деле платит заказчик. Я хочу показать, что остается за кадром этих 20 секунд и из чего складывается цена. Потому что в одной задаче ИИ действительно заметно сокращает бюджет, а в другой экономии может не быть совсем.
В Studio :We базовая стоимость составляет от 1 500 рублей за секунду готового видео без учета НДС 5%. Рекламный ролик продолжительностью 20 секунд стоит от 30 000 рублей. Почему «от»? Потому что 20 секунд могут быть очень разными.
Можно показать один продукт на одном фоне в двух-трех сценах, а можно за те же 20 секунд сменить пять локаций, провести через них постоянного персонажа, заставить его взаимодействовать с продуктом, добавить речь, музыку и сохранить его консистентность. Хронометраж одинаковый, но объем работы очень разный.
Цена за секунду нужна как понятная отправная точка. Но считать по ней любой сценарий так же странно, как оценивать ремонт только по площади квартиры. Десять квадратных метров пустой комнаты и десять квадратных метров ванной с плиткой и сантехникой стоят по-разному.
Для начала нам нужно понять, что именно клиент хочет получить. Где будет размещен ролик? Что в нем важнее: точность продукта, атмосфера, персонаж или сюжет? Какие детали нельзя менять ни при каких обстоятельствах? Что уже есть у бренда, а что нужно создавать с нуля? Этот этап кажется очевидным, но именно здесь начинает формироваться будущая стоимость.
Например, задача «хотим эффектно показать парфюм» может означать две совершенно разные задачи. В первой достаточно сохранить общую форму и цвет продукта, потому что ролик имиджевый. Во второй нужно в точности воспроизвести этикетку, крышку, пропорции и каждую надпись. Первый вариант нейросеть сделает сравнительно легко, а вот во втором придется отдельно готовить исходные изображения, контролировать продукт в каждой сцене, исправлять детали и иногда создавать кадр из нескольких элементов.
После брифа мы готовим персонажей (ИИ-моделей для ролика), точные локации и создаем раскадровку. Обычно это занимает 1-2 рабочих дня. Клиент видит будущую последовательность сцен до начала основного производства и может сказать: «Да, именно это я имел в виду» или «Нет, давайте поменяем идею». Мне этот этап кажется принципиальным. Лучше здесь поспорить о раскадровке, чем после десятков генераций выяснить, что все представляли ролик по-разному.
Это самая невидимая часть ИИ-производства. В портфолио клиент видит несколько красивых секунд, но в рабочей папке команды остаются десятки версий, которые никто никогда не покажет.
В одной персонаж выглядит правильно, но странно двигает рукой. В другой движение хорошее, зато изменился продукт. В третьей все почти получилось, но фон внезапно стал другим. Четвертая просто скучная. Пятая эффектная, но не подходит бренду.
На поиск одной рабочей сцены может уйти несколько часов и десятки генераций. И это не значит, что нейросети плохие. Они просто не выдают предсказуемый результат по команде, как обычная программа.
Мы используем Seedance, Veo, Kling и другие модели. Иногда сцена лучше получается в одной нейросети, иногда в другой. Инструменты быстро меняются, поэтому умение написать длинный промпт само по себе уже не выглядит для нас большой ценностью.
Ценность в другом: понять, почему результат не работает, выбрать другую модель или способ генерации, сохранить нужные детали и вовремя остановиться, когда дальнейшие попытки уже не улучшают ролик.
Допустим, нужные сцены получились. Но это еще далеко не готовое видео. Далее мы их собираем в один ритм и настроение, где-то нужно обрезать, выровнять по цвету, подчистить артефакты, добавить графику, текст, логотип, звук, липсинк (синхронизация речи с артикуляцией персонажа) и проверить, как все выглядит вместе.
Особенно осторожно мы работаем с надписями и упаковкой. Я бы не доверяла генеративной модели финальный логотип бренда или мелкий текст на товаре. Такие элементы лучше контролировать отдельно, а не надеяться, что нейросеть случайно сделает все правильно.
На монтаж короткого ролика может уйти еще несколько часов. Если нужен голос, используем ElevenLabs, для музыки можем использовать Suno, но и здесь результат приходится отбирать и подгонять под видео. Нейросеть создает материал. Решение о том, что войдет в финальную версию, все равно принимает человек.
Если мы говорим о базовом ролике до 20 секунд, в стоимость входят:
Простой ролик можно сделать от 72 часов. Если в нем несколько сложных сцен, постоянный персонаж, точная работа с продуктом, озвучка или дополнительные версии, производство обычно занимает от 5 рабочих дней.
Два раунда правок не означают, что после финала можно заменить продукт, переписать сценарий и добавить новую сцену. Если мы утвердили раскадровку, а потом появляется новая идея «а давайте героиня еще зайдет в кафе» - это уже новая генерация. Она рассчитывается отдельно, по той же схеме - от 1 500 рублей за секунду новой сцены.
Я считаю важным говорить об этом заранее. Иначе клиент думает, что покупает неограниченное количество попыток, а команда в какой-то момент понимает, что делает уже другой ролик в прежнем бюджете.
Можно найти смету классического продакшна и доказать почти любой процент экономии. Поэтому я бы не обещала универсальные 40%, 60% или «в десять раз дешевле». Иногда разница действительно огромная. Например, если для 20-секундного ролика нужны фантазийная локация, сложные декорации, несколько образов и необычная трансформация продукта. В съемке пришлось бы строить пространство, искать реквизит, команду и заниматься постпродакшном. В ИИ значительная часть этих расходов исчезает. Хорошо работают и серии. Когда бренд регулярно выпускает ролики с одним персонажем и в одном стиле, не нужно каждый раз собирать съемочную площадку заново.
Но бывает и наоборот. Простой предметный ролик на готовой локации иногда дешевле снять. Особенно если клиенту нужно не придумать новый мир, а точно показать реальный товар. Поэтому я не очень люблю формулировку «ИИ заменяет съемку». Он заменяет дорогие и сложные этапы в конкретной задаче. Если таких этапов нет, экономия может оказаться гораздо скромнее.
Есть задачи, в которых от ИИ требуется не просто создать убедительный кадр, а в точности воспроизвести реальность. Например, показать посадку конкретной модели одежды, работу оборудования, фактуру товара, реального человека или интерьер определенного помещения.
Именно здесь чаще всего возникает сложность в точной передаче. Нейросеть может создать правдоподобный флакон, но это будет не обязательно ваш парфюм. Может показать эффектное платье в движении, но изменить крой, длину или поведение ткани.
В таких проектах мы не заставляем ИИ заново придумывать то, что должно остаться неизменным. Берем реальные фотографии или видео продукта, упаковки, человека или пространства, а с помощью нейросетей создаем окружение, движение камеры, переходы, дополнительные сцены и эффекты.
Получается гибридный ролик: ключевые детали соответствуют реальности, ИИ добавляет то, что было бы сложно или дорого снять обычным способом. Мне кажется, именно в эту сторону постепенно движется рынок. Клиенту не так важно, какой процент видео создан нейросетью. Важно, чтобы ролик решал задачу, убедительно показывал продукт и укладывался в бюджет.
Да и я не буду убеждать, что любой ролик нужно обязательно заказывать у продакшна. Если вы хотите проверить идею, сделать видео для внутренней презентации или выпустить простой пост, можно открыть нейросети и попробовать. Иногда задача удачно ложится в модель и хороший результат получается быстро.
Проблемы начинаются, когда нужно повторить успех во второй, пятой и десятой сцене. Сохранить одного персонажа и не изменить продукт. Подготовить несколько форматов. Исправить именно то, что важно, а не всю сцену целиком.
Самостоятельная генерация почти ничего не стоит, кроме стоимости подписки на нейросети, если не считать ваше время и не требовать от результата высокой точности. Для бизнеса именно эти два условия обычно и оказываются самыми дорогими.
Я бы спросила, что входит в стоимость, сколько будет версий и раундов правок, кто занимается монтажом и звуком, что произойдет, если модель не даст нужной точности, и какие права получает клиент на готовое видео.
Еще я бы попросила показать не только красивый финал, но и процесс: раскадровку, промежуточные варианты, исходный и доработанный кадр. По ним гораздо лучше видно, есть ли за результатом производство или вам просто перепродают первую удачную генерацию.
За то, чтобы из десятков непредсказуемых попыток получился один предсказуемый рекламный ролик. Чтобы продукт не менялся, сцены складывались в историю, музыка не жила отдельно от изображения, а клиент заранее понимал, что он получит и сколько это займет.
ИИ-видео может быть быстрее и дешевле обычной съемки. Но оно не становится готовым автоматически только потому, что отдельный кадр генерируется за несколько минут.
Если у вас есть идея ролика, можно прислать ее и референсы и мы предложим, как реализовать задачу с помощью ИИ, реальных исходников или гибридного подхода, и дадим ориентир по срокам и бюджету.